Can Transformers Learn the Language of the Microbiome?
Outpost Bioは、MGnifyデータベース由来の50万件を超えるマイクロバイオームデータで事前学習したGPT-2型の言語モデルを公開した。あわせて、8つの予測タスクからなる標準ベンチマークも提示している。ラベルなしの大規模データでの事前学習が性能向上につながり、データセットが1万サンプルを超える領域では事前学習済みTransformerが従来手法のベースラインを上回ったという。モデル、データセット、ベンチマークはいずれもHugging Face上でオープンソースとして公開されている。
無料登録で、調達額・投資家・記事全文が読めます(メールアドレスのみ)。
無料で登録する