QDHUAC — 多様な振る舞いを大幅に短い時間で発見する

・ Luffy AI 受賞・採択

QDHUAC – Discovering Diverse Behaviours in a Fraction of the Time

Luffy AI の研究チームは、論文「Distributional Value Estimation Without Target Networks for Robust Quality-Diversity」で Genetic and Evolutionary Computing Conference の Best Paper Award を受賞した。この研究は、quality-diversity 手法と深層強化学習を組み合わせたターゲットネットワーク不要の actor-critic アルゴリズム QDHUAC を提案し、既存のベースラインより一桁少ない環境ステップ数で同等の性能を達成する。QDHUAC はハイブリッド正規化と分布型 critic により学習を安定化させつつ、新規な振る舞いの発見を阻害するとされるターゲットネットワークの悲観的バイアスを取り除いている。

Luffy AI 公式サイト Researchで全文を読む ↗

Luffy AI の他のリリース