自己教師あり学習

Self-Supervised Learning (SSL)

人手のラベルを使わず、データ自体から作った疑似的な課題(プリテキストタスク)を解かせて表現を学習する手法。大量の未ラベルデータをそのまま学習に使えるため、大規模な基盤モデルの事前学習で標準的な方法になっている。課題の設計と学習設定の選び方が結果を左右する。

詳細

概要

自己教師あり学習は、人手で付けたラベルに頼らず、データそのものから教師信号を作って学習する枠組みである。文章の一部を隠して当てさせる、同一の対象から作った異なる入力を近づけるといった課題(プリテキストタスク)を設定し、その過程で汎用的な表現を獲得させる。

技術的な要点

解説論文「A Cookbook of Self-Supervised Learning」は、自己教師あり学習を知能のダークマターと呼びつつ、その学習が繊細な技芸であり参入障壁が高いと指摘している。同論文によれば、構成要素の多くは既知のものであるにもかかわらず、プリテキストタスクの選択から学習ハイパーパラメータの設定に至るまで、目のくらむほど多くの選択が成否を左右する。同論文はこうした手法の体系と実践的な設定を整理し、参入障壁を下げることを目的として書かれている。

産業での位置づけ

ラベル付けのコストが表現学習の上限を決めていた状況を変え、Web 上のテキストや画像に加え、工場のセンサログや医用画像のように大量に存在するがラベルの付いていないデータを学習資源に変える。ラベル取得が高価な領域ほど効果が大きく、専有データを持つ企業の優位性と結び付きやすい。