ニュース › Hugging Face #新モデル Hugging Face 2026年1月28日 ClaudeがCUDA Kernel開発とオープンモデル教育に対応 イメージ このニュースの全文は、配信元でお読みいただけます。 Hugging Faceで元記事を読む → 編集部の実践記録から 当社が自社の業務でAIを動かし、処理件数・所要時間・失敗件数まで 実際に測った記録です。 AI解体新書 AIエージェントの「移行できました」は信じてよいのか?30件中29件を成功と自己申告し、実際に通ったのは22件 IBM Researchが公開したScarfBenchは、Enterprise Javaのフレームワーク間移行をAIエージェントに解かせるベンチマークです。最上位のエージェントでも挙動を保った移行の成功率は10%未満、アプリ全体移行30件では29件を成功と自己申告しながら実際にビルドできたのは22件でした。検収基準の置き方を考え直す材料になります。 続きを読む → AI解体新書 会議室や工場で音声認識AIの精度はどれだけ落ちるのか(低SNR環境で誤り数倍) Treble TechnologiesがHugging Faceと共同で公開したFFASRリーダーボードは、無響の2,000サンプルを14部屋でシミュレーションし、9条件のうち4条件でASRを比較しました。低SNR(6dB未満)では単語誤り率が近接環境の数倍。ベンダー公表値の読み方と、自社での検証手順を整理します。 続きを読む → AI解体新書 手順書を足せばAIエージェントは賢くなるのか?正答率67%→43%、あるタスクでは100%→0%になった記録 Hugging Faceが自社ツール上でオープンモデルのエージェント能力を3段階の構成で測ったところ、手順書(Skill)を同梱した構成で小型モデルの一致率が67%から43%に落ち、あるタスクでは100%から0%になりました。同じ作業のトークン消費が約2,400から約23,000へ振れた例もあります。中小企業がPoCで何を測るべきかを整理します。 続きを読む →
AI解体新書 AIエージェントの「移行できました」は信じてよいのか?30件中29件を成功と自己申告し、実際に通ったのは22件 IBM Researchが公開したScarfBenchは、Enterprise Javaのフレームワーク間移行をAIエージェントに解かせるベンチマークです。最上位のエージェントでも挙動を保った移行の成功率は10%未満、アプリ全体移行30件では29件を成功と自己申告しながら実際にビルドできたのは22件でした。検収基準の置き方を考え直す材料になります。 続きを読む →
AI解体新書 会議室や工場で音声認識AIの精度はどれだけ落ちるのか(低SNR環境で誤り数倍) Treble TechnologiesがHugging Faceと共同で公開したFFASRリーダーボードは、無響の2,000サンプルを14部屋でシミュレーションし、9条件のうち4条件でASRを比較しました。低SNR(6dB未満)では単語誤り率が近接環境の数倍。ベンダー公表値の読み方と、自社での検証手順を整理します。 続きを読む →
AI解体新書 手順書を足せばAIエージェントは賢くなるのか?正答率67%→43%、あるタスクでは100%→0%になった記録 Hugging Faceが自社ツール上でオープンモデルのエージェント能力を3段階の構成で測ったところ、手順書(Skill)を同梱した構成で小型モデルの一致率が67%から43%に落ち、あるタスクでは100%から0%になりました。同じ作業のトークン消費が約2,400から約23,000へ振れた例もあります。中小企業がPoCで何を測るべきかを整理します。 続きを読む →