Transcript
00:00:00昨日、Anthropic社がFable 5.1をリリースしました。これは同社が公開したモデルの中で初めて
00:00:04生成するすべてのものにウォーターマークを付与するモデルとなります。本日は、そのウォーターマークを回避する方法をご紹介します。
00:00:10ですがその前に、このウォーターマークとは一体何なのかについてお話ししましょう。というのも、「ウォーターマーク」と呼ぶのは
00:00:14少々ミスリーディングだからです。なぜ最初からこれが存在し、どのように機能するのかを見ていきます。
00:00:19これらの仕組みを理解すれば、このウォーターマークを回避する解決策がぐっと分かりやすくなるからです。
00:00:23そもそも、なぜこんなことに対応しなければならないのでしょうか?それはこれが、
00:00:26XAIを除く主要なフロンティアラボのほとんどが署名した、EU人工知能法(EU AI Act)に
00:00:31準拠しているためです。この法案が定めているのは、EU側が必要としているということです。
00:00:38何らかのテキストや出力結果がAIによって作成されたものかどうかを判別する手段を求めているのです。
00:00:43そのため、Anthropicは2026年8月2日以降にリリースされたモデルのすべての出力にウォーターマークを追加しました。
00:00:50まさに今回のFable 5.1がそれに該当します。Anthropic社は、これが実際の出力結果に対して実用上の
00:00:56影響を及ぼすことはなく、コードに関する変更点についても非常に限定的であると主張しています。
00:00:59しかし、この仕組みは実際どのように機能するのでしょうか?そして、なぜ先ほどミスリーディングだと呼んだのでしょうか?
00:01:03Anthropicがこのウォーターマークを出力に埋め込む戦略は、2024年にGoogleから発表された
00:01:07「大規模言語モデルの出力識別におけるスケーラブルなウォーターマーキング」という論文に基づいています。
00:01:13これは比較的専門性の高い論文であり、SynthIDのトーナメントベースのウォーターマーキングについて深く掘り下げています。
00:01:19ですが、理解しやすいようにシンプルなメンタルモデル(思考の枠組み)で説明させてください。
00:01:25ご存知の通り、大規模言語モデルとその出力は確率に基づいており、一定のランダム性が含まれています。
00:01:29例えば「彼女は空白です」という文を与えて穴埋めさせるとします。
00:01:34その場合、文を完成させるために使用できる単語のリストが候補に挙がることになります。
00:01:41例えば、その候補の単語が「美しい」「魅力的」「ゴージャス」「可愛い」だとしましょう。実際には、
00:01:48これらの単語には、大規模言語モデルがどれを選択するかに関して、それぞれ異なる割合や確率が紐づけられています。
00:01:54よく耳にする用語として「ソフトマックス」というものがありますが、ここで理解すべきなのは、これらすべての単語に
00:01:58大規模言語モデルがどれを選択するかに関する確率が関連付けられているということです。
00:02:04この思考実験のために、これらすべてが全く同じ確率を持っていると想像してください。
00:02:08つまり、文を完成させるためのこれらの単語はそれぞれ25%の確率で選ばれる状態だとします。
00:02:14通常、ウォーターマークが導入される前であれば、モデルはその中から1つをランダムに選んでいました。
00:02:204面サイコロを振って「美しい」が選ばれたとしましょう。これで問題ありませんね。それぞれ25%の
00:02:26確率があり、どの単語も選ばれる可能性は均等でした。しかし現在は異なるシステムで稼働しており、それが
00:02:31ウォーターマーキングシステムです。ウォーターマーキングシステムを導入しても、先ほどと同様の状況を想定できます。
00:02:38つまり、「彼女は空白ですという文を穴埋めしてほしい、選択肢は4つあります」と指示するような場合です。
00:02:42そして再び、これら4つの単語があり、確率が同じだとしましょう。ウォーターマーキングの仕組みを追加すると、
00:02:49何が行われるかというと、本質的にこのサイコロに重みがつけられます。もしこれが何らかの
00:02:544面サイコロなのだとしたら、「ウォーターマークの目的のために、『美しい』の確率を50%にして
00:03:01『ゴージャス』を30%にしよう」といった具合に変更されます。このようにウォーターマークの仕組みを組み込むと、
00:03:10特定の単語が選ばれやすくなり、より大きな重みが付けられるようになります。
00:03:15特定の単語に重みが大きく置かれるため、大規模言語モデルがそれらを選択する際、
00:03:19結果としてそれらの単語がより頻繁に出現するようになります。ウォーターマークシステムを使用すると、
00:03:25より高い確率で「彼女は美しい」と言い表すようになるのです。エンドユーザーであるあなたには、
00:03:32これらの単語がどれなのか、どの単語により重みが置かれているのかは全く分かりません。しかし、キーを所持している人物、
00:03:40つまりウォーターマークの秘密鍵を持っている人にはそれが分かります。ただし、絶対的な確実性を持って
00:03:45判別できるわけではありません。以前と同様に、「彼女は美しい」と言われる偶然の可能性は常に存在していたからです。
00:03:49ウォーターマークによって必然的に確率が高められていたのかどうかは、見た目だけでは判断できません。しかし、
00:03:55鍵を持つ人であれば、どの単語により重みが置かれていたのかを識別することができます。そしてその結果、
00:04:01鍵を持つユーザー(すなわち欧州の規制当局など)に対して、次のような確率を提示することになります。「このテキストが作成された確率は90%、100%、あるいは99%の確率で
00:04:09Claudeを使って書かれたもの、またはAIによって書かれたものです」と。このようにして仕組みが成り立っています。
00:04:15ここで重要なのは、ウォーターマークによって変更され、より重み付けされるこれらの単語が、
00:04:20文全体の意味を変えてしまうわけではないという点です。出力結果が変わるわけではありません。
00:04:24パフォーマンスが変わるわけでもありません。特にコードについて言えば、
00:04:28出力の外観に影響を与えるようなコードの変更が行われることはありませんし、事実が曲げられることもありません。
00:04:34例えば「この歴史的事件は8月10日に発生した」という場合、その表現が変更されることはありません。
00:04:41それは事実であり、8月10日に発生したのですから。そこが書き換えられることはありません。
00:04:45しかし、これはこのシステムがどのように機能するかを簡略化した説明に過ぎません。
00:04:52Anthropicは、その仕組みの正確なアルゴリズムを完全に公表しているわけではありませんが、
00:04:57DeepMindの論文などからそれを外挿することは可能です。そしてそこから汲み取るべきことは、
00:05:02この鍵を持つことこそが、ウォーターマークの仕組みに基づいてAIによって書かれたかどうかを知る唯一の方法であるということです。
00:05:08そしてこの鍵は公開されていません。鍵にアクセスするには、アクセスを申請する必要があります。公開リストなど存在せず、
00:05:12おそらく何らかのEU規制当局などである必要があります。ですから、「自分のウェブサイトを使えば
00:05:16ウォーターマークが入っているか判別できる」などと謳う人がいても、それは嘘であり、そんなものは存在しません。
00:05:21テキストのウォーターマークがどのように機能するかについてさらに詳しく知りたい場合は、Anthropicの公式記事もあります。
00:05:25彼らは、これが出力結果に影響を与えることはないと強く主張しています。
00:05:29したがって、ウォーターマーキングシステムの本質は、特定の単語が他よりも頻繁に選ばれるようにすることに他なりません。
00:05:35これは統計的アルゴリズムであり、鍵を持たない限り、エンドユーザーであるあなたがそれを解読することは決してできません。
00:05:40では、どうやってこれを解決すればいいのでしょうか?Claudeが生成するテキスト出力に対して軽い編集を加えるだけで、
00:05:47それがうまく機能することを期待すればよいのでしょうか?それとも、全体を実質的に書き直す必要があるのでしょうか?
00:05:52そして、どうやって書き直せばよいのでしょうか?どのような文章であれClaudeを使って書き直すことはできません。
00:05:56なぜならそれにもウォーターマークが付いてしまうからです。同様にChatGPTを使うこともできませんし、Geminiを使うこともできません。
00:06:01したがって、選択肢は非常に明確になります。全体の雰囲気を維持しつつ、テキストの大部分を書き直す必要があり、
00:06:09XAIを使用するか、あるいは可能性として最も高いのは何らかのオープンソースモデルを使用することになります。
00:06:16自分のコンピューターにダウンロードして実行できる、例えば中国製のオープンソースモデルなどが挙げられます。
00:06:21それを使えば、A:無料で利用でき、B:これらのウォーターマーク法の規制対象外となります。
00:06:28では、実用的な観点からそのシステムはどのようなものになるでしょうか?通常通りすべての出力をClaudeで行います。
00:06:33そして、例えば長めのブログ記事のような何かを作成し、それにウォーターマークのフラグを立てたくない場合は、
00:06:37その出力結果を利用します。次に、それを何らかのローカルモデルに送信します。
00:06:42Claudeを使ってそれを行うことも可能です。OLAMA経由でダウンロードできる非常に優れたローカルモデルはたくさんあります。
00:06:47そのローカルモデルが処理を実行し、テキストを書き直してくれます。
00:06:51プロンプトで次のように指示します。「実際の雰囲気を維持してほしい。自分のボイスノートなどを挿入してもいい、など」と。
00:06:55そして処理が完了すると、その正確な応答がそのままClaudeに送り返されるため、
00:07:01その時点であとは自由に行うことができます。
00:07:05さて、この全体を通して考慮すべきもう一つの変数が、出力の長さです。
00:07:09つまり、何トークンくらいの長さを想定しているかという点です。これは実際には事前に分からない数値ですが、
00:07:14検出APIが実行された際に、AIによって書かれたとある程度の確信を持って判断されるためには、
00:07:19出力がどれほどの長さでなければならないのかという問題があります。
00:07:25もし「彼女は美しい」といった短いLinkedInのコメントを書くだけであれば、APIはそれがClaudeで書かれたかどうかを本当に判別できるでしょうか?
00:07:31できません。ですから、自分の文章にウォーターマークが入り、Claudeによるものだと帰属表示されることを
00:07:37ひどく恐れているのであれば、こう自問してみてください。「そもそも問題になるほど長文を書いているだろうか?」と。
00:07:41LinkedInの投稿や、100語未満のコメントなどの場合であれば、おそらく問題ありません。
00:07:46しかし、数千語に及ぶような巨大なブログ記事の場合はどうでしょう。その場合は、ウォーターマークが検出され、
00:07:51Claudeで書かれたことが一目瞭然になってしまうでしょう。
00:07:56これを手っ取り早くセットアップする最も簡単な方法は、Ollamaをダウンロードし、
00:08:00自分のハードウェアに適したローカルモデルをダウンロードした上で、Claude内にスキルを作成することです。
00:08:05そのスキルを呼び出すと、出力がそのローカルモデルに送信されて完全に書き直され、
00:08:10手元に戻ってくるようになります。これを簡単に行えるよう、プロセス全体をあなたとClaudeに案内するプロンプトを作成しました。
00:08:15これをClaudeにコピー&ペーストするだけで、Claudeがあなたのハードウェアの調査を行ってくれます。
00:08:20あなたに適したローカルモデルを判断し、Ollamaが未導入であればダウンロードおよびインストールを行ってくれます。
00:08:24その後、スキルを作成し、書き直しの文体をどのようにするかを決定するための質問をしてくれます。
00:08:28基本的にはあなたの文体を取り入れたり、例文を作成したりといった作業を行ってくれます。
00:08:35実際に実行するためのリンクを下に貼っておきます。このプロセス全体を次の10分間かけて一歩ずつ説明するよりも、
00:08:40このプロンプトを実行していただければ、すべて自動で行ってくれます。
00:08:44ウォーターマークに関する一連の解説が納得のいくものであれば幸いです。これは実際のウォーターマークではありません。
00:08:48裏側で何かが書き込まれているわけでも、コードが存在するわけでもありません。単に特定の単語がより頻繁に使用されるようになるというだけです。
00:08:53どの単語がそれに該当するのか、あなたには全く分かりません。それを判別できる唯一の方法は、
00:08:57ウォーターマークの鍵を所持していることですが、規制当局でもない限り、それを手に入れることはできません。
00:09:02したがって、「ウォーターマークが入っているかどうかを判別できる」と主張する人は基本的に嘘をついていると言えます。その点を最初に知っておいてください。
00:09:07そしてこの仕組みを踏まえると、先ほど述べたように、必要であればDeepMindの論文を掘り下げてみてください。
00:09:11これを回避する唯一の方法は、徹底的な編集を行うことです。軽い編集では不十分であり、
00:09:16全体を完全に書き直す必要があります。そしてそれを実現するための唯一の方法が、オープンソースモデルを使用することです。
00:09:20それが最も費用対効果の高い方法となります。そのプロンプトを入手したい場合は、
00:09:24下のリンクから見つけることができます。今回の内容が皆さんのお役に立てば幸いです。
00:09:29正直に申し上げますと、
00:09:33物事がウォーターマーク化されるといった件に関しては、全体的にやや誇張されすぎているように思います。
00:09:38AIを使って文章を作成している人々の大部分は、人間らしく見せたり自分らしいトーンにしたりする方法を
00:09:43ほとんど理解していないため、それがAIであることはすでに痛いほど明白です。
00:09:49そして、投稿するあらゆる場所や、すべてのウェブサイトに何らかのウォーターマーク検出機能が備わり、
00:09:52それが重大なタブーとされるような状況にならない限りは問題ありません。
00:09:58繰り返しになりますが、ローカルモデルに通すだけで実質的に厄介ごとを回避できるのです。
00:10:02今回の感想をぜひ聞かせてください。さらに深く学びたい方は、Chase AI+をチェックして
00:10:06Cloud Code Masterclassを手に入れてください。
00:10:10それでは、ウォーターマークの回避をお楽しみください。
Community Posts
No posts yet. Be the first to write about this video!
Write about this video