ニュース › Hugging Face Hugging Face 2026年7月7日 LeRobot v0.6.0、想像・評価・改善を実装 画像: Hugging Face(配信元より) このニュースの全文は、配信元でお読みいただけます。 Hugging Faceで元記事を読む → この話題に関連する、TOEの実践・観測記録 ニュースの背景を、当社が実際にAIを動かした一次記録から補足します。 AI解体新書 AIの正解ラベルは100件で足りるのか?7,241件分の精度に到達した選び方と、9回中5回失敗した落とし穴 7,241件のデータプールからAI自身の不確実性で100件だけ選ぶと、全データ学習とほぼ同じ精度に届いた。一方で1回きりの微調整は9シード中5シードが物理的にありえない出力を学習し、検証スコアはそれを検知できなかった。ラベル作成コストに悩む中小企業が読むべき、選び方と止め方の設計を解説する。 続きを読む → AI解体新書 ベンチマークのモデル順位は、比べる相手が偏ると順位一致度0.60未満まで崩れるのか 人間のテスト理論である項目反応理論をAI評価に持ち込んだ18,000条件のシミュレーション研究。評価対象モデルの能力分布が偏ると順位再現度は0.60を割り、モデル数30では項目の難易度推定が0.50を下回った。一方で上位10%の項目だけでも順位再現は保てた。中小企業が「ベンチマーク上位」をどう読むかの材料として整理する。 続きを読む → AI解体新書 AIに文書チェックを任せるなら、1つのプロンプトで全部やらせるのと工程ごとに分けるのと、どちらが精度が出るのか? 論証エッセイの自動採点システムWrAFTは、採点・表層修正・深層コメントの3工程を分割し、それぞれ別のLLMと手法を割り当てた。採点はファインチューニングでRMSE 0.57→0.44に改善したが、深いコメントではファインチューニング版が出力欠落を起こし素のプロンプトに負けた。工程分割の実証データを中小企業の文書チェック業務に引き写して読む。 続きを読む → 御社でもAIを使ってみませんか まずはここから 御社でもAIを使ってみませんか? 御社の実際の業務を題材に、AIで何ができるかを一緒に考えます。 「ChatGPTの使い方」を教えるだけの研修ではありません。 AI研修・AI活用相談 → AI検索で自社がどう見えるか知りたい ChatGPTやPerplexityで自社が言及されるかを実際に測ります。 引用を約束するものではなく、まず現状を測るサービスです。 AI検索可視性診断 → Webサイトを改善したい 測った結果、サイト側に原因があった場合の改善まで対応します。 Web制作25年・1000案件の実績があります。 SEO・Webサイト改善 →
AI解体新書 AIの正解ラベルは100件で足りるのか?7,241件分の精度に到達した選び方と、9回中5回失敗した落とし穴 7,241件のデータプールからAI自身の不確実性で100件だけ選ぶと、全データ学習とほぼ同じ精度に届いた。一方で1回きりの微調整は9シード中5シードが物理的にありえない出力を学習し、検証スコアはそれを検知できなかった。ラベル作成コストに悩む中小企業が読むべき、選び方と止め方の設計を解説する。 続きを読む →
AI解体新書 ベンチマークのモデル順位は、比べる相手が偏ると順位一致度0.60未満まで崩れるのか 人間のテスト理論である項目反応理論をAI評価に持ち込んだ18,000条件のシミュレーション研究。評価対象モデルの能力分布が偏ると順位再現度は0.60を割り、モデル数30では項目の難易度推定が0.50を下回った。一方で上位10%の項目だけでも順位再現は保てた。中小企業が「ベンチマーク上位」をどう読むかの材料として整理する。 続きを読む →
AI解体新書 AIに文書チェックを任せるなら、1つのプロンプトで全部やらせるのと工程ごとに分けるのと、どちらが精度が出るのか? 論証エッセイの自動採点システムWrAFTは、採点・表層修正・深層コメントの3工程を分割し、それぞれ別のLLMと手法を割り当てた。採点はファインチューニングでRMSE 0.57→0.44に改善したが、深いコメントではファインチューニング版が出力欠落を起こし素のプロンプトに負けた。工程分割の実証データを中小企業の文書チェック業務に引き写して読む。 続きを読む →