機能するRTLの生成:限られたデータでのカリキュラム学習と報酬設計に関する研究

・ Architect Labs その他

Functional RTL generation: A study in curriculum learning and reward shaping with limited data

Architect Labs は、オープンなベースモデル Kimi-K2.5 に対し、検証可能な報酬による強化学習(RLVR)で追加学習を行い、Verilog 生成の性能を高めた。できあがったモデル Architect v0.1 は CVDP ベンチマークで pass@1 54.5% を記録し、Claude Opus 4.6 と同水準、GPT-5.4 を上回った。性能向上は学習データの追加ではなく、報酬設計とカリキュラム学習によるものだとしている。学習可能な難易度帯に絞ったカリキュラムによって、スコアは52.5%から54.5%へ引き上げられた。

Architect Labs 公式ブログ(Research)で全文を読む ↗

Architect Labs の他のリリース