Self-Supervised Learning (SSL)
自己教師あり学習は、人手で付けたラベルに頼らず、データそのものから教師信号を作って学習する枠組みである。文章の一部を隠して当てさせる、同一の対象から作った異なる入力を近づけるといった課題(プリテキストタスク)を設定し、その過程で汎用的な表現を獲得させる。
解説論文「A Cookbook of Self-Supervised Learning」は、自己教師あり学習を知能のダークマターと呼びつつ、その学習が繊細な技芸であり参入障壁が高いと指摘している。同論文によれば、構成要素の多くは既知のものであるにもかかわらず、プリテキストタスクの選択から学習ハイパーパラメータの設定に至るまで、目のくらむほど多くの選択が成否を左右する。同論文はこうした手法の体系と実践的な設定を整理し、参入障壁を下げることを目的として書かれている。
ラベル付けのコストが表現学習の上限を決めていた状況を変え、Web 上のテキストや画像に加え、工場のセンサログや医用画像のように大量に存在するがラベルの付いていないデータを学習資源に変える。ラベル取得が高価な領域ほど効果が大きく、専有データを持つ企業の優位性と結び付きやすい。