Anthropic公布Claude内容标记实施口径
新模型标记承诺落地,但命中只说明可能经Claude处理,不能独立鉴真。
本文要点
- 新Claude模型从一般透明承诺变为以欧盟上线日期切分的发布条件。
- 文本输出与受支持文件被明确分配给水印和C2PA两条不同技术链。
- 旧模型被确认仍在迁移,检测机制细节也仍待后续文档。
阅读辅助
先看数字、证据和来源,再读正文。
在欧盟于8月2日及以后上线的新Claude模型将从发布时支持机器可读标记。
2025-09 · 欧盟AI办公室启动AI生成内容透明度准则的咨询与参与者征集。
欧盟相关透明度义务于2026年8月2日开始适用后,Anthropic在8月10日19:03:20(UTC)更新Claude帮助页。页面把机器可读标记设为新模型的发布条件:在欧盟于切分日及以后上线的新Claude模型,从发布时支持标记。
实施路径被拆成两类。受支持模型生成文本时嵌入不可见水印;Claude生成受支持文件时附加符合C2PA开放标准的签名来源元数据。官方列出5个产品入口,同时保留平台、功能和文件类型差异。
公开页面仍留下明确缺口:逐模型开关清单、公开检测器、误报率、漏报率、最短可靠长度和编辑后的保留曲线均未公布。旧模型仍在迁移,第三方检测方法要等后续技术文档。
对开发者、内容平台和学校而言,最重要的操作原则是把标记作为来源信号,并把作者认定与事实核查留给额外证据。正向命中不证明Claude写下了全部内容,负向未命中也不证明没有使用AI,更不能由此直接判断违规行为或内容真假。
一张口径表:五件事不能混写
官方说明把适用时间、输出类型、技术机制和检测含义分开。下面的对照是理解这次更新的最短路径。
| 问题 | 官方实际口径 | 可以写成 | 不能写成 |
|---|---|---|---|
| 哪些新模型 | 在欧盟于2026年8月2日及以后上线的新Claude模型,发布时支持标记 | 新模型以欧盟上线日期为切分点 | 2026年8月2日后所有Claude调用都已统一标记 |
| 文本怎样标记 | 受支持模型在生成文本时嵌入不可见水印,复制粘贴时随文本移动,并可能经部分编辑保留 | 文本标记属于文本自身的统计信号 | 文本靠文件元数据或肉眼可见字符标记 |
| 文件怎样标记 | 受支持文件附C2PA签名来源元数据,举例为SVG、PNG和JPG共3种格式 | 文件可携带可验证的处理来源记录 | 所有文件、截图和转码结果都永久保留凭证 |
| 旧模型怎样处理 | 官方正在为2026年8月2日前发布的模型增加支持,可用后再更新说明 | 旧模型处在过渡期 | 旧模型已经全部迁移,或历史输出会被回溯加标 |
| 检测说明什么 | 命中表示内容可能经Claude处理;未命中仍可能是AI生成或处理 | 把结果作为调查线索并结合其他证据 | 把结果当作Claude原创、学生作弊或内容真实的单一证明 |
这张表还包含一个容易被忽略的地理边界。模型切分条件是“在欧盟上线”,但对已经支持标记的模型,Anthropic称标记会在Claude可用地区对输出全球适用。它不是“只有欧盟用户会收到标记”,也不是“全球所有旧模型同时完成升级”。
发布承诺的范围,落在模型、产品、云与地区四层
模型层最清楚。官方使用的是“launched in the EU on or after August 2, 2026”,因此日期锚定的是新模型在欧盟的上线,不是用户发出某次请求的时间。帮助页没有逐项列出哪些模型已经满足条件,故报道只能保留规则,不能替Anthropic补一张不存在的支持名单。
产品层覆盖官方点名的5个入口:Claude Platform(API)、Claude、Claude Code、Claude Cowork与Claude Tag。这里仍有两个限定词。其一,标记只来自“受支持模型”;其二,部分平台或功能可能不支持某种标记。产品在清单里,不等于该产品里每个模型、每种输出和每次转换都拥有同一种凭证。
云合作伙伴层进一步拉开差异。官方称,受支持模型通过AWS、Google Cloud或Microsoft Foundry访问时,嵌入式文本水印也会适用;签名来源元数据则可能因各平台提供的功能不同而无法支持。于是,同一个模型在两条通道上的状态可能不同:文本水印存在,不代表下载文件一定附C2PA清单。
地区层的表述是“wherever Claude is offered, worldwide”。这说明受支持模型的标记并非只对欧盟请求启用。它也解释了为什么一项由欧盟透明度规则推动的变更会影响全球API和Claude Code工作流。企业不能只靠IP地区判断某份输出有无标记,应依据具体模型、入口、文件类型和处理链核验。
旧模型的状态必须单独写。Anthropic称法律包含过渡期,公司正在为2026年8月2日前发布的Claude模型增加标记支持,并会在能力可用后更新帮助页。working to add表达进行中的迁移,不是完成状态;页面也没有给出截止日期。由此既不能说旧模型永远不标记,也不能说它们现在已经全部标记。
两条技术链:文本携带信号,文件记录来源
文本水印被描述为直接“织入”文字。Anthropic称它不可见,不改变回应的含义、质量或可读性;因为水印属于文本,所以复制粘贴到别处时仍会随行,也“可能”在部分编辑后保留。这里的may persist through some editing必须保留概率和范围:它没有承诺经任意改写、翻译、摘要或混写后仍能检测。
公开页面没有说明编码算法、密钥体系、语言覆盖或检测阈值。仅凭“不可见”不能推断它使用零宽字符,也不能把社区对词序、token选择或统计分布的猜测当成Claude具体实现。Hacker News在8月10日出现大量讨论,能够证明的是市场开始关注误报与教育场景后果;讨论本身不能补齐未公开的算法细节。
文件路径采用C2PA签名来源元数据。官方举例包括SVG、PNG、JPG共3种受支持格式。若签名标签存在,它可以表明文件曾经由Claude处理,并让验证者检查文件与签名记录是否匹配、后续是否发生破坏完整性的改动。这里描述的是来源与完整性验证,不是对画面内容“是否真实发生”的判断。
C2PA 2.2说明把Content Credential定义为与资产加密绑定的来源记录,其中可包含来源、修改、AI使用和签名者等断言。规范同时明确,凭证只验证这些来源信息是否格式有效、签名可信且未被篡改,不对其中叙述作价值或事实真伪判断。一个签名完整的AI图片仍可能描绘虚构事件;一个没有凭证的真实照片也不能因此被自动判假。
| 维度 | 文本嵌入式水印 | 文件C2PA签名元数据 |
|---|---|---|
| 载体 | 生成文本本身 | 受支持的数字文件及其C2PA清单 |
| 官方列举范围 | 所有来自受支持模型的生成文本 | SVG、PNG、JPG等受支持文件 |
| 跨流程表现 | 复制粘贴会随文本移动,部分编辑后可能保留 | 转码、重存、截图等可能剥离或破坏元数据 |
| 命中能说明 | 文本可能经Claude处理 | 文件带有可验证的Claude处理来源信号 |
| 不能说明 | Claude是唯一作者、全文均由Claude原创 | 文件描绘的事情真实、来源链完整无缺 |
| 当前公开缺口 | 算法、阈值、误报率、漏报率和检测接口 | 平台支持矩阵、格式全集、元数据恢复与撤销流程 |
这两种技术被称为互补,并不意味着它们会在同一输出里总是同时出现。普通聊天文本可以只有文本水印;图片或矢量文件可能带C2PA记录;平台不支持文件元数据时,则可能只有文本侧能力。将二者都缩写成“水印”会遮掉企业最需要核对的传播路径。
正向命中不是作者证明,负向未命中也不是无AI证明
Anthropic对正向检测给出的限定很强:发现受支持标记,表示内容“可能”由Claude处理,不能单独确认完整来源。Claude可能只做过校对、翻译、摘要或文件格式转换,底层观点、原始文字和数据仍来自人类或另一套系统。标记还能随处理后的输出存在,因此“Claude接触过”与“Claude原创”是两种不同主张。
内容在Claude处理后还可能被截取、拼接或再次修改。即便标记正确命中,也无法仅凭这个信号回答哪一段来自谁、最后编辑者改了什么、发布者是否获得授权。学术诚信、版权归属和内容审核都需要额外证据,例如版本历史、原始文件、引用记录、账号日志、编辑过程与适用规则。
负向检测的缺口更多。官方列出了至少五类情况:生成内容来自尚未支持标记的旧模型;文本被重度编辑、改写、翻译或混入其他文字;片段太短而无法形成可靠信号;文件在格式转换、重存或截图时丢失元数据;所用平台、功能或文件类型本来就不支持相应标记。这些不是边缘例外,而是日常内容链里的常见动作。
所以检测结果不能被简化成二元开关。更合理的结果模型至少要包含“检测到受支持标记”“没有检测到”“输入不足”“格式不支持”“凭证存在但验证失败”“凭证签名者未知”等状态。Anthropic尚未公开最终接口,平台在接入前尤其不应自行把“未命中”显示为“人类创作”。
误报问题也不能被一句“嵌入式标记比风格检测可靠”带过。官方页没有公布完全由人类写作的文本被判为Claude处理的概率,也没有给出不同语言、文体和长度下的置信阈值。Hacker News评论集中担心学校或机构把一次命中当作处分依据,这属于社区风险提示;在独立测试与申诉机制出现前,不能把担忧写成已经发生的普遍误判,也不能忽略它。
欧盟规则是推动力,不是可靠性担保
欧盟委员会页面说明,AI Act Article 50相关透明度义务从2026年8月2日起适用。提供者侧目标包括让音频、图像、视频和文本以机器可读方式标记,并在技术可行范围内做到有效、可互操作、稳健和可靠。实践准则为自愿采用的合规工具,但Article 50透明度要求本身属于法律义务。
“在技术可行范围内”十分关键。欧盟页面要求考虑不同内容类型的特性与限制、实施成本和公认技术水平。这套规则促使厂商公开方案、提供检测与改进互操作,却不会自动把任何水印变成零误报、零漏报的司法鉴定。Anthropic帮助页主动列出的限制,恰好说明合规信号仍需与具体使用场景的证据标准分开。
提供者与部署者的职责也不同。模型或系统提供者要实施机器可读标记和检测支持;发布深度伪造或某些公共利益文本的部署者,还可能承担面向人的披露责任。企业调用Claude后再编辑和公开内容,不能假定底层模型标记已经替自己完成全部标签、通知和审查义务。Anthropic也明确提醒开发者独立评估Article 50对自身产品和服务的要求。
企业接入应先建立“证据梯度”
内容平台可以把Claude标记作为来源图谱的一条边:记录检测器版本、检测时间、输入长度、文件哈希、签名验证状态和所见Claude处理声明。若内容后来修改,系统还应保存新旧版本关系,而不是用新结果覆盖旧结果。这样才能区分“曾在某一版本命中”和“当前版本仍可检测”。
教育和招聘场景需要更高门槛。一次命中最多触发人工核查,不应直接形成作弊或代写结论;一次未命中也不能替提交者自动背书。流程中要给当事人查看原始检测记录、解释使用场景和提交版本历史的机会,并允许对检测器版本、输入截取和不支持格式提出异议。
开发者还要拆开文本与文件测试。文本侧应测试中文、英文及混合语言,覆盖短段落、长文、校对、摘要、翻译、局部改写与多模型混写。文件侧应测试下载、压缩、重存、格式转换、截图、CDN优化和办公软件导出,逐步记录C2PA清单是否保留、失效或被剥离。只有这种链路测试,才能知道产品实际留住的是哪一种信号。
云平台的差异需要写进采购表。AWS、Google Cloud和Microsoft Foundry上的受支持模型按官方口径会应用文本水印,但签名来源元数据可能并非处处可用。企业若依赖文件凭证做审计,必须确认具体区域、模型版本、API、响应格式和下载流程,而不能只看“Claude受支持”这一行。
Anthropic这次把内容标记从抽象合规承诺拆成了可讨论的产品边界:新模型有明确的上线切分点,文本与文件走不同机制,旧模型承认仍在过渡,检测能力承认仍缺技术文档。把这些限制明确写出,才构成当前最重要的透明度增量。
内容来源体系的合理角色是“增加可验证上下文”,而非替代事实核查与作者认定。文本水印更接近Claude处理痕迹,C2PA更接近带签名的文件履历;二者都能缩小调查范围,却都不能单独回答作品由谁创作、陈述是否真实、使用是否违规。把处理痕迹升级为身份结论,会把技术信号变成制度性误伤。
对Anthropic而言,下一阶段的竞争不只在是否加标,还在能否公开可复现的可靠性曲线。若没有多语言误报率、编辑后召回率、最短文本阈值、逐模型支持矩阵和检测器版本治理,外部机构只能知道“存在一个标记”,无法判断一次结果应承担多大证据权重。
反面边界也应保留。水印可能在大规模平台治理、内容追踪和模型输出去重中提供实用增量,C2PA也能让完整文件的来源记录更容易验证。风险来自决策层级失配:低风险推荐可以把它当特征,高风险处分、版权或法律判断则必须要求独立证据和人工复核。
后续要等的不是口号,而是性能与治理材料
第一类材料是可复现的检测性能。Anthropic需要按语言、文本长度、文体和编辑强度公布误报率与漏报率,并解释置信分数如何校准。尤其要区分复制、轻改、重写、翻译、摘要和多来源混写;“可能经部分编辑保留”只有变成曲线和测试集,才足以支持产品策略。
第二类材料是支持矩阵。外部需要知道哪些新模型已经按规则上线,哪些旧模型完成迁移,Claude的5个产品入口分别支持文本和文件中的哪些标记,以及三家云伙伴的差异。模型别名和后端版本变更也应有可审计记录,否则同名API在不同时点的检测预期无法复现。
第三类材料是检测器治理。后续技术文档应说明第三方如何访问检测能力,密钥和证书如何轮换,旧检测器如何识别新模型,撤销或泄露怎样处理,争议结果如何申诉。文件侧还要说明C2PA清单被剥离后能否通过软绑定恢复;文本侧则要说明输入不足与真实未命中的界面差异。
在这些材料出现前,可以确定的是Anthropic已经公开一套从新模型开始的标记承诺,并明确两条技术链和一组限制。仍不能确定的是它在真实内容链里的可靠度。任何把“检测到Claude标记”直接翻译成“Claude原创”,或把“没有检测到”翻译成“未使用AI”的产品,都会越过官方文档自己划下的证据边界。