何が起きたのか

Anthropicが公式サポート記事「How Claude marks AI-generated content」を公開し、Claudeの出力に機械可読なマーキングを施すことを明らかにしました(Anthropic公式サポート)。内容は二本立てです。テキストには「imperceptible watermark(知覚できない透かし)」をテキスト自体に織り込み、ファイル(.svg / .png / .jpg など)にはC2PA(Coalition for Content Provenance and Authenticity)標準に準拠した署名付きprovenanceメタデータを付与します。

適用範囲が広いのが特徴です。公式記事はClaude Platform(API)、Claude、Claude Code、Claude Cowork、Claude Tagを列挙しており、地域は全世界。AWS、Google Cloud、Microsoft Foundry経由でもテキスト透かしは機能するとされますが、ファイルの署名付きメタデータは「may not be supported on every platform」と留保が付いています。

タイミングは明快です。公式記事は「Claude models launched in the EU on or after August 2, 2026 will support machine-readable marking at launch」と書いています(Anthropic公式サポート)。ローンチ時から対応するという約束は、EU AI Actの行動規範に関するセクション配下で、EU向けの文言として記されている点に注意が必要です。ただし同記事は別に「Marking will apply to output from supported models wherever Claude is offered, worldwide」とも述べており、マーキングの適用範囲そのものは全世界です。2026年8月2日より前にリリースされたモデルについては「The law includes a transition period for Anthropic models launched before August 2, 2026, and we’re working to add marking support for those models as well」と、法定の移行期間に言及しつつ対応中である旨が記されています。この2026年8月2日という日付は偶然ではなく、EU AI Act第50条の透明性義務の適用開始日と一致します(European Commission)。Anthropicはこの措置の根拠として、第50条(2)に対応する「Code of Practice on Transparency of AI-Generated Content」への署名を挙げています。


制度側の背景:190組織が署名した行動規範

欧州委員会は2026年6月10日に同行動規範の最終版を公開しました(European Commission 2026-06-10)。規範自体は任意ですが、生成AIの提供者・展開者がAI Actの透明性義務を満たすための実務的な道筋として位置づけられており、署名しない事業者は「同等に適切な代替手段」で適合を示す必要があります。

2026年7月末時点で約190組織が署名し、内訳はSection 1(提供者向け)82、Section 2(展開者向け)152でした(European Commission 2026-07-31)。Section 1にはAnthropicのほかGoogle、Meta、Microsoft、OpenAI、Mistralが名を連ねています。署名者リストは欧州委員会が随時更新するため、この内訳は7月末時点のスナップショットです。

Anthropicが言う「transition period」の中身も法令で確定しています。2026年7月24日に官報公布された Digital Omnibus on AI(Regulation (EU) 2026/1744)がAI Act第111条に第4項を追加し、「Providers of AI systems, including general-purpose AI systems, generating synthetic audio, image, video or text content, that have been placed on the market before 2 August 2026 shall take the necessary steps in order to comply with Article 50(2) by 2 December 2026」と定めました。前文はこれを「a transitional period of four months」と説明しています。第50条の適用開始日が2026年8月2日から動いたわけではなく、既存システムの提供者にだけ4か月の猶予が与えられた形です。

前史も追えます。AnthropicのTransparency Hubには、透かしについて業界・学術界と連携しつつ「preparing for compliance with applicable laws by the relevant legal deadlines」と記載されていました(Anthropic Transparency Hub)。同ページはさらに、Claudeの出力について「multimodal input capabilities and text-based outputs, including text-based artifacts and text-to-speech voice output」と記しています。画像・動画向けprovenanceについては、Thornの「Safety by Design」コミットメント一覧に「Include content provenance on image and video outputs」が挙がっています(Anthropic Transparency Hub)。なお同ページの「Claude currently does not generate image or video outputs of people」という記述は、児童保護(CSAM・NCII)の文脈で人物の画像・動画に限って書かれたもので、画像ファイルの出力一般を否定したものではありません。実際、今回のサポート記事は署名対象の例として.svg / .png / .jpgを挙げています。今回のアップデートは、このうち「テキストにどう印を付けるか」という宿題に対する回答にあたります。


公式が言ったこと、言っていないこと

仕様として読むと、明言された範囲は意外に狭いことが分かります。

明言されたのは次の点です。透かしはテキストの一部であるため「it will travel with the text when it’s copied and pasted elsewhere, and may persist through some editing」。検出できた場合の意味は「content may have been processed by Claude」であって「does not, on its own, confirm the full provenance of the content」。逆に印が無くても否定にはならず、「heavily edited, paraphrased, translated, or mixed into other writing」された場合や、ファイルのメタデータが「format conversion, re-saving, screenshots」で剥がれた場合には検出できません。

一方で、公式記事が書いていないことも多い。透かし方式のアルゴリズム名、検出器の提供時期と提供形式、除去耐性の定量値(何%の編集まで残るのか)、誤検出率、そしてオプトアウトの手段です。検出の担い手については「We’re also working to enable users and other third parties to detect Claude’s embedded watermarks and provenance metadata」と、ユーザーと第三者に開く方針までは書かれています。ただしそこから先は「We’ll share details on detection mechanisms in forthcoming technical documentation」とあるのみで、記事公開時点では検出ツールも技術文書も出ていません。企業向けの例外規定やオプトアウトの記載も見当たりません。

比較対象として、Google DeepMindのSynthID-Textは方式を論文として公開済みです(Nature 2024-10-24)。トーナメント方式のサンプリングで透かしを埋め込み、約2,000万件のGeminiの応答を対象としたライブ実験で品質非劣化を報告しています。方式が公開されているかどうかは、後述する「検出結果をどこまで信じてよいか」の議論に直結します。


どこまで残るのか──z統計で見積もる

Anthropicは方式を明かしていないため、以下はテキスト透かしの一般的な枠組みを使った見積もりです。以降に出てくる $\gamma$・green比率・閾値はいずれもAnthropicが公表した値ではなく、この節の数値をClaudeの透かしの耐性そのものとして読むことはできません。それでも計算しておく価値はあります。「どんな量が効くのか」——出力の長さと書き換え量——は方式が変わっても効き方の骨格が共通だからです。

このクラスの手法の代表例が、Kirchenbauerらのgreen-list方式です(arXiv:2301.10226)。生成の各ステップで語彙 $V$ を疑似ランダムに分割し、割合 $\gamma$ の「green list」に属するトークンのロジットへバイアス $\delta$ を加えて、わずかに選ばれやすくします。人間が書いた文章ならgreenの出現率は $\gamma$ に収束するはずで、そこからのズレを一標本比率のz検定で測ります。長さ $T$ トークンの文章にgreenが $|s|_G$ 個含まれるとき、

$$z = \frac{|s|_G - \gamma T}{\sqrt{T\gamma(1-\gamma)}}$$

分子が「期待からの超過」、分母が二項分布の標準偏差です。ここで効いてくるのは $z \propto \sqrt{T}$ という依存関係で、短い出力ほど検出は原理的に弱くなります。

具体的に入れてみます。以下の $\gamma = 0.25$ と生成時green比率 $0.5$ は、論文の設定例に沿って置いた仮の値です。$T = 200$ なら

$$z = \frac{0.5 \times 200 - 0.25 \times 200}{\sqrt{200 \times 0.25 \times 0.75}} = \frac{50}{6.12} \approx 8.2$$

片側p値でおよそ $10^{-16}$ 台。ただしこの値は「人間が書いた文章だと仮定したときに、これほどgreenが偏る確率」であって、「Claude製である確率」ではありません。逆向きに読み替えると誤りになります。ところが $T = 50$ まで短くすると $z \approx 4.1$ まで落ちます。コミットメッセージ、変数名の提案、一文の回答——短い出力がこの領域に入るのは $z \propto \sqrt{T}$ から出る帰結で、方式の詳細にはあまり依存しません。

編集による希釈も同じ式で扱えます。編集で置き換わったトークンの割合を $\rho$ とし、置換後のトークンがgreenになる確率を $\gamma$ とみなすと、観測green比率は $p' = (1-\rho) \times 0.5 + \rho \times 0.25$ です。$T = 200$ で計算すると、$\rho = 0.5$(半分書き換え)で $z \approx 4.1$、$\rho = 0.8$ で $z \approx 1.6$。閾値を $z = 4$ に置くなら、この仮定の下では半分の書き換えでぎりぎり、8割の書き換えで消える計算になります。Claudeの実装でこの数字になるという意味ではありませんが、書き換え量が増えれば検出力が単調に落ちること自体はこのクラスの手法に共通で、公式記事の「may persist through some editing」という控えめな表現とも方向は矛盾しません。

誤検出のコストも $z$ の選び方で決まります。Kirchenbauerらは $z > 4$ で帰無仮説を棄却する例を挙げ、「the probability of a false positive is $3 \times 10^{-5}$」と書いています。学生のレポート10万件をスキャンすれば、人間が書いた文章のうち3件前後が「機械生成」と判定される計算です。

しかも同論文は、この誤検出が全員に等しく降りかかるわけではないことも認めています。ある2-gramがたまたまgreen listに当たると、その言い回しを多用する人間の文章は「erroneously flagged as machine-generated」になり得る——論文はハッシュ長を伸ばす、反復n-gramを検出計算から除外するといった緩和策を挙げていますが、定型文の多い書き手ほど不利になる構造は残ります。この数字が許容できるかは、判定に何が紐づくか(不合格、懲戒、契約解除)に依存します。公式記事が「may have been processed」という言い回しを繰り返しているのは、こうした運用上の誤用を避けるための予防線と読めます。


ファイル側:C2PAは署名であって透かしではない

テキストとファイルで性質が違う点は押さえておく価値があります。C2PAメタデータは暗号署名付きのマニフェストをファイルに添付する仕組みで、改ざんの有無を検証できる一方、メタデータそのものは容易に落とせます。公式記事も、フォーマット変換・再保存・スクリーンショットでメタデータが剥がれると明記しています。スクリーンショットを一度挟めば消えるということです。

つまり今回のアップデートでは、テキストのほうが「しつこく残る」印で、ファイルのほうが「壊れやすいが検証可能な」印という非対称な構成になっています。対象形式の書き方も実務では効きます。公式記事が署名付きメタデータの対象として挙げているのは「a supported file type, such as a .svg, .png, or .jpg」という例示にとどまり、対象形式の完全なリストは示されていません(Anthropic公式サポート)。したがって、Claude Codeが吐くPythonファイルやMarkdown、Claude Coworkが生成するドキュメントがC2PAの対象に含まれるかどうかは、現時点の公開情報からは判断できません。それらが「テキスト」として透かし側の対象になり得るかどうかも、公式記事が明示していないため断定はできません。


残された不確実性

  • ソースコードの扱いが不明:公式記事はコードやソースファイルに一切言及していません。透かしがトークン分布へのバイアスとして実装される場合、構文的制約の強いコードでは品質劣化と検出力のトレードオフが自然言語と大きく異なります。Claude Codeの出力に印が入るのか、入るとして関数名や空白の選択に影響するのかは、技術文書の公開待ちです。
  • 検出器の提供形式:公式記事は「users and other third parties」が検出できるようにすると書いており、Anthropicの内部運用に留める選択肢は事実上外れています。書かれていないのはその形式です。公開APIとして誰にでも開かれるのか、教育機関や出版社への限定提供になるのかで意味は変わります。オープンな検出器は除去攻撃の設計を容易にし、クローズドな検出器は判定への異議申し立てを困難にします。どちらにもコストがあります。
  • 除去耐性の定量値:本記事の見積もりは一般的な方式に基づく試算であり、Anthropicの実装値ではありません。実際の $\gamma$、$\delta$、閾値設計は未公開です。
  • 既存モデルの移行完了時期:2026年8月2日より前のモデルについて、Anthropicは「working to add marking support」とするのみで、自社の完了予定日を示していません。ただし法令側の期限は2026年12月2日で確定しており(AI Act第111条(4))、無期限の猶予ではありません。移行期間中は、同じClaudeでもモデルによって印の有無が変わることになります。
  • オプトアウトの不在が確定なのか:公式記事に記載がないことと、制度として存在しないことは別です。エンタープライズ契約やゼロデータ保持構成での扱いは、現時点の公開情報からは判断できません。

まとめ

Anthropicが公表したのは、テキストへの不可視透かしとファイルへのC2PA署名という二層のマーキングの方針と適用範囲です。公式記事のEU向けの記載では2026年8月2日以降にローンチする新モデルが提供開始時から対応、それ以前のモデルは移行中とされており、既存モデルを含むClaude全体で対応が完了したという発表ではありません。適用範囲はAPI・Claude・Claude Code・Claude Cowork・Claude Tagにまたがり、全世界が対象。直接の制度的背景はEU AI Act第50条の透明性義務と、Anthropicが署名した行動規範で、既存システムの猶予は2026年12月2日までと法令で区切られています。

技術的に読むと、この印は「あることは一定の証拠、ないことは何の証拠でもない」という非対称な性質を持ちます。大幅な書き換え・翻訳・他文書への混入で検出できなくなることは公式記事自身が認めており、検出統計量が出力長の平方根で効く一般的な枠組みで見る限り、短い出力での検出も原理的に弱い。自ら限界を書いている点は評価できますが、肝心の検出手段と定量的な耐性は「forthcoming technical documentation」に委ねられたままです。API出力を製品に組み込んでいる側にとっては、まず自社の出力経路のどこにこの印が乗るのかを把握することが先で、除去や回避を考えるのはその後の話になります。


主要出典


関連する過去記事