『一番賢いモデル』が一番得とは限らない ― OCR で LLM のコスパを実測する
はじめに OCR(画像や PDF を文字データに変換する処理)に、いまは LLM(大規模言語モデル)が使えます。ただ「どのモデルを、どの設定で使うのが一番得か」は、公称スペックやベンチの評判だけでは決まりません。対象データが変われば最適解も変わるからです。 そこで書籍1冊の OCR を題材に、複数の Gemini モデルとその「思考量(thinking level)」を変えながら、精度とコストを測りました。先に結論を言うと、コストと本文の読み取り精度のバランスで本命になったのは、最高精度のモデルではなく、軽量な Flash-Lite を中程度の思考量で使う設定でした。以下、測り方・...
出典: Zenn AI(配信元の紹介文より引用)
このニュースの全文は、配信元でお読みいただけます。 Zenn AIで元記事を読む →
御社でもAIを使ってみませんか
まずはここから
御社でもAIを使ってみませんか?
御社の実際の業務を題材に、AIで何ができるかを一緒に考えます。
「ChatGPTの使い方」を教えるだけの研修ではありません。
AI研修・AI活用相談 →

