Functional RTL generation: A study in curriculum learning and reward shaping with limited data
Architect Labs は、オープンなベースモデル Kimi-K2.5 に対し、検証可能な報酬による強化学習(RLVR)で追加学習を行い、Verilog 生成の性能を高めた。できあがったモデル Architect v0.1 は CVDP ベンチマークで pass@1 54.5% を記録し、Claude Opus 4.6 と同水準、GPT-5.4 を上回った。性能向上は学習データの追加ではなく、報酬設計とカリキュラム学習によるものだとしている。学習可能な難易度帯に絞ったカリキュラムによって、スコアは52.5%から54.5%へ引き上げられた。
Architect Labs 公式ブログ(Research)で全文を読む ↗
無料登録で、調達額・投資家・記事全文が読めます(メールアドレスのみ)。
無料で登録する