Model soups 論文解説:Transformer 時代の重み平均
1. はじめに 大規模な事前学習済みモデルを下流タスクへ適応する際には、学習率、weight decay、データ拡張、学習回数などを変えながら複数のモデルを fine-tuning し、検証性能が最も高い 1 モデルを採用するのが一般的である。この手順では、選ばれなかったモデルは以後利用されない。しかし、それらも異なるハイパーパラメータのもとで学習された有効な解であり、互いに異なる予測特性を持っている可能性がある。 複数モデルの情報を利用する代表的な方法がアンサンブルである。各モデルの "予測" を平均することで、単体モデルより高い精度や頑健性を得られることが多い。一方、k 個のモデ...
出典: Zenn AI(配信元の紹介文より引用)
このニュースの全文は、配信元でお読みいただけます。 Zenn AIで元記事を読む →


