QDHUAC – Discovering Diverse Behaviours in a Fraction of the Time
Luffy AI の研究チームは、論文「Distributional Value Estimation Without Target Networks for Robust Quality-Diversity」で Genetic and Evolutionary Computing Conference の Best Paper Award を受賞した。この研究は、quality-diversity 手法と深層強化学習を組み合わせたターゲットネットワーク不要の actor-critic アルゴリズム QDHUAC を提案し、既存のベースラインより一桁少ない環境ステップ数で同等の性能を達成する。QDHUAC はハイブリッド正規化と分布型 critic により学習を安定化させつつ、新規な振る舞いの発見を阻害するとされるターゲットネットワークの悲観的バイアスを取り除いている。
Luffy AI 公式サイト Researchで全文を読む ↗
無料登録で、調達額・投資家・記事全文が読めます(メールアドレスのみ)。
無料で登録する