大規模言語モデルは事前学習で膨大な知識を獲得しますが、人間の意図に合わせるためには、教師ありファインチューニング(SFT)、強化学習(RL)、オンラインポリシー分布(OPD)などのポストトレーニング手法が重要です。この記事では、これらの手法がモデルの出力分布を静的な事前学習パターンから動的でタスク最適化された行動へとシフトさせる仕組みを体系的に比較しています。著者は、SFTがモデルを特定のデモンストレーションに固定するのに対し、RLは探索と報酬最大化を促進し、OPDは継続的なフィードバックループを導入して破滅的忘却を軽減すると説明します。モデルアライメントに取り組む開発者や研究者にとって、これらの分布シフトを理解することは効果的なトレーニングパイプラインの設計に不可欠です。この分析は、会話型AIやコーディングアシスタントなど、微調整された言語モデルを必要とするアプリケーションに特に有用です。
SFT、RL、OPDがポストトレーニング中にモデル分布に与える影響を深掘りし、能力学習、汎化、忘却を解説。