LLM Routing
モデルルーティングは、入力された要求ごとに、性能とコストの異なる複数の言語モデルから実行先を選ぶ仕組みである。能力の高いモデルは応答品質が高い一方で費用も高く、小さいモデルは安価だが品質が劣るという関係を、要求単位の振り分けによって緩和することを狙う。
RouteLLMの論文は、推論時に問い合わせを強いモデルと弱いモデルのいずれかへ動的に振り向けるルータを学習する枠組みを示している。学習には人間の選好データとデータ拡張を用い、振り分けの精度を高める。広く用いられるベンチマークでの評価では、応答の品質を損なうことなく、場合によっては2倍を超えるコスト削減が得られたと報告されている。さらに、試験時に強弱モデルの組み合わせが変わっても性能が保たれる転移性が示されており、利用可能なモデルが頻繁に入れ替わる運用環境でも扱いやすいとされる。
エージェントを本番環境で継続稼働させる基盤では、推論費用が運用コストの相当部分を占めるため、ルーティングは連続バッチング、キャッシュ、量子化などと並ぶコスト最適化の手段となる。実装上は、品質・遅延・費用のどれを制約としどれを目的とするかの定義と、振り分け結果を事後に検証できる記録の設計が論点となる。