Claudeのテキスト透かし(ウォーターマーク)は何をしているのか ── サンプリングの仕組みから理解する
AnthropicがClaudeの出力テキストに透かし(ウォーターマーク)を入れると発表した。透かしはLLMの重みには一切手を加えない。次トークンを選ぶ「サンプリング」という段階にのみ介入する。秘密鍵と直前数トークンから乱数シードを決め、その結果に基づいて候補トークンを選ぶのだ。本質的には「乱数シードを固定しているのとほぼ同じ」である。仕組みで見るとLLM本体はそのままなので、再学習は不要。既存モデルにそのまま適用できる。個人的に刺さったのは、この透かしがシンプルながら実務的に設計されているという点だ。透かしが「どのトークンを選ぶか」に働きかけるとき、重要なのは「選ばれるのは、どのみち候補に入っていた、もっともらしいトークン」という点だ。たとえば「The weather today is cold and ___」という位置なら「gray」と「overcast」がほぼ同じくらいもっともらしい。透かしなしなら、どちらが選ばれるかはほぼコイントス。透かしありでは秘密鍵がそれを「どちらか」に定める。つまり、意味的にはもっともらしい選択肢の中での選択なので、透かしで文章の品質が落ちる心配は、仕組み上はあまり当たらない。Anthropicがそう言っているのはこの事実に基づいている。しかし透かしを検出するには秘密鍵が必要だ。鍵を持たない我々には、テキストが透かし入りかどうか判定できない。Anthropicは検出APIを用意する予定だが、一般公開されるのか限定提供なのかは不明である。Googleが発表したSynthID-Textという技術が参考になっている。各候補トークンにビット署名を付け、トーナメント形式で勝ち残りを決める方式だ。こうしておくと、検出側は非常に単純になる。テキストの各位置についてビットを出し、全位置の平均を取るだけで「透かしあり」か「なし」かの判定が可能になる。計算コストが大幅に削減されるわけだ。検出に秘密のLLM再実行が不要になるのが、トーナメント方式の唯一にして最大の目的である。透かしの弱点は「単語を書き換えれば消える」ことだ。ただし、どの位置が透かし位置かは外からは分からない。したがって現実的には、あちこち適当に言い換えて、十分な数の透かし位置に当たることを祈るしかない。AI記事を大量生産するサイトなら、Claude→ローカルモデルで言い換え編集→透かし消去、というパイプラインを組むかもしれない。その場合、元の文章より少し不自然になる可能性は高い。広がりつつあるGeminiやOpenAIの同等技術と合わせると、透かし検出は産業標準に向かう可能性がある。
※ 上記は配信元記事をもとにAIの鬼編集部が要約・再構成したものです。正確な内容は出典元をご確認ください。
このニュースの全文は、配信元でお読みいただけます。 Zenn AIで元記事を読む →

