ニュース › Hugging Face Hugging Face 2026年7月28日 OlmoEarthプラットフォーム:地球規模の地理空間推論 イメージ このニュースの全文は、配信元でお読みいただけます。 Hugging Faceで元記事を読む → この話題に関連する、TOEの実践・観測記録 ニュースの背景を、当社が実際にAIを動かした一次記録から補足します。 AI解体新書 学習データを71%捨てても精度は落ちないのか?場所認識AIの実測で見る「データ選別」の費用対効果 AIの精度はデータ量で決まる、という前提を疑う実測が出ました。画像による場所認識AIの学習で、データを71%削減しても精度は維持され、総学習時間は19.152時間から4.825時間へ74.8%削減。データを増やす前に選別する工程を挟む、という予算配分の話として読めます。ただし対象は特定タスクに限られます。 続きを読む → AI解体新書 AIの評価軸を「正答率」から「越えてはいけない線」に変えられるか——医療AI検査ベンチマーク100件の設計 臨床医1名が作った医療AI安全性ベンチマーク「MedFailBench」は、合成症例100件を6種類の失敗ゲートと5段階の重大度で分類した。正解率ではなく「どの安全境界が破られたか」で測る設計思想は、中小企業の社内AI評価表にそのまま応用できる。ただし実験規模は極端に小さく、論文自身が限界を並べている。 続きを読む → AI解体新書 検索精度スコアは、AIエージェントの正解率を予測できるのか(相関ρ=-0.0257) 複数ステップで自律検索するAIエージェントを対象に、従来の検索有用性スコアと、実際に正解へ効いた度合いの相関を測った研究。23,322件の文書観測で相関はρ=-0.0257とほぼ無相関、単体では答えを含まないのに削除すると結果が変わる「橋渡し文書」が35.72%を占めた。社内文書検索の評価の見方に直結する話です。 続きを読む →
AI解体新書 学習データを71%捨てても精度は落ちないのか?場所認識AIの実測で見る「データ選別」の費用対効果 AIの精度はデータ量で決まる、という前提を疑う実測が出ました。画像による場所認識AIの学習で、データを71%削減しても精度は維持され、総学習時間は19.152時間から4.825時間へ74.8%削減。データを増やす前に選別する工程を挟む、という予算配分の話として読めます。ただし対象は特定タスクに限られます。 続きを読む →
AI解体新書 AIの評価軸を「正答率」から「越えてはいけない線」に変えられるか——医療AI検査ベンチマーク100件の設計 臨床医1名が作った医療AI安全性ベンチマーク「MedFailBench」は、合成症例100件を6種類の失敗ゲートと5段階の重大度で分類した。正解率ではなく「どの安全境界が破られたか」で測る設計思想は、中小企業の社内AI評価表にそのまま応用できる。ただし実験規模は極端に小さく、論文自身が限界を並べている。 続きを読む →
AI解体新書 検索精度スコアは、AIエージェントの正解率を予測できるのか(相関ρ=-0.0257) 複数ステップで自律検索するAIエージェントを対象に、従来の検索有用性スコアと、実際に正解へ効いた度合いの相関を測った研究。23,322件の文書観測で相関はρ=-0.0257とほぼ無相関、単体では答えを含まないのに削除すると結果が変わる「橋渡し文書」が35.72%を占めた。社内文書検索の評価の見方に直結する話です。 続きを読む →