公开英文机构资讯翻译整理 - 网站地图

兼顾搜索可见性与禁止AI训练

时间:2026-10-10 04:46:45 来源:数字安全观察 作者:数字安全观察 阅读:250次

如果没有适当的控制措施,网站所有者长期以来面临一个艰难的取舍:允许你的内容被用于 AI 训练,还是冒着在搜索中失去可发现性的风险。这种取舍之所以存在,是因为互联网上一些最大的组织使用混合用途爬虫:单个爬虫同时服务于搜索和 AI 训练。拒绝其中一个,就等于拒绝另一个。

文章主题示意图
主题配图,非事件现场。摄影:Tima Miroshnichenko / Pexels

今天,Cloudflare 宣布了一项新的“禁止 AI 训练”设置,让你可以轻松保持被搜索索引,同时拒绝让同一个爬虫用你的内容进行训练。Apple、Google 和 Microsoft 尊重或已承诺(在指定时间范围内)尊重这一设置。

混合用途爬虫是训练问题中最棘手的部分。AI 摘要则是下一个。全站范围的“是”或“否”过于粗放:你的内容有多少出现在摘要中,与它是否出现同样重要。AI 摘要的选择退出已经是我们为混合用途爬虫运营方设定的要求之一。到明年初,我们的目标是让你控制自己的内容被纳入多少——在 Cloudflare 上设置一次,而不是分别与每个运营方设置。

为什么仅仅询问还不够

大多数网站所有者希望被找到:被人、代理和(好的)机器人找到。但开放互联网的很大一部分由广告、订阅或与访客的直接关系提供资金,而这些模式只有在有人真正到访时才能带来收益。

几乎所有网站所有者都认为搜索有益:不到 1% 的 Cloudflare 网站选择屏蔽搜索机器人。然而,训练则是另一回事:17% 的网站选择启用某种机制来阻止训练。这正是我们决定网站所有者需要更精细控制、而不是一刀切“屏蔽 AI”的原因。

仅靠 robots.txt 指令无法解决这个问题。任何人都可以发布一条,但它无法识别谁在爬取、确定他们为何爬取,也无法阻止无视它的爬虫。

然而,网络可以解决这个问题:我们发布偏好,识别谁在爬取,对其爬取原因进行分类,并阻止那些无视偏好的爬虫——然后在 Radar 上报告每个运营方的实际行为。

但屏蔽会移除一个爬虫。它不会改变爬虫的行为方式。更好的结果是运营方根本不让你做选择。因此,自 7 月以来,我们一直在直接与他们沟通。回应令人鼓舞:几乎所有人都同意,网站所有者应该对自己的内容如何使用拥有控制权和透明度,并应得到其选择会被尊重的保证。为了帮助网站所有者理解这一点,我们设立了一个称号:Accountable(负责任)。

Accountable 称号既认可当前已具备的能力,也认可交付这些能力的具体承诺。要获得资格,机器人运营方必须满足或承诺满足以下要求:

为网站所有者提供通过 robots.txt 或类似标准选择退出 AI 训练的机制。

为网站所有者提供直接与运营方设置、并于明年通过 Cloudflare 设置的选择退出 AI 摘要的机制(详见下文)。

URL 级别的可见性,可查看哪些页面被用于训练,以及显示内容如何出现在搜索中的指标。

保证选择退出 AI 训练不会影响传统搜索结果。

Apple、Google 和 Microsoft 都证明它们符合 Accountable 的资格。每一家都将当前已具备的能力与对仍在开发中的能力的有时限承诺相结合。以下分享这些公司各自爬虫的详细信息。

新的安全设置选项

Cloudflare 按行为对机器人进行分类,单个机器人可以表现出不止一种行为。有三种行为可作为控制项:

搜索——为构建搜索索引而爬取。

训练——为训练或微调模型而爬取。

代理——代表人类访问页面的用户导向代理,例如聊天抓取机器人和浏览器使用代理。

混合用途爬虫是同时执行搜索和训练的单个爬虫。如果没有控制措施,这种组合就会造成上述取舍:网站所有者无法在不拒绝另一种用途的情况下拒绝其中一种用途。

为了避免屏蔽 Accountable 混合用途爬虫——那些不把这种取舍强加给网站所有者的爬虫——我们引入了一项新设置:禁止 AI 训练。禁止 AI 训练因其在你的 robots.txt 中发布的 Disallow: 指令而得名。

“屏蔽”设置现在含义不同

屏蔽和“在有广告的页面上屏蔽”此前不适用于混合用途爬虫,因为屏蔽它们也可能影响搜索可发现性。现在我们有了新的禁止 AI 训练设置,屏蔽和“在有广告的页面上屏蔽”适用于所有训练爬虫,包括混合用途爬虫。

训练、搜索和代理控制项在域名级别应用。加上禁止 AI 训练后,可用设置如下:

允许:允许所有爬虫,除非被其他设置或 WAF 规则阻止。

禁止 AI 训练:Bot Preference Sync 在 robots.txt 中发布适用的禁止训练偏好。Accountable 混合用途爬虫仍被允许用于搜索。其他所有训练爬虫都被阻止,包括 Amazon、Anthropic、Meta 和 OpenAI 运营的仅训练爬虫——阻止这些不会影响搜索。禁止 AI 训练仅作为训练的设置提供,不适用于搜索或代理。

在有广告的页面上屏蔽:爬虫(包括混合用途爬虫)仅在检测到投放广告的页面上被阻止。

屏蔽:所有爬虫(包括混合用途爬虫)都被阻止。

禁止 AI 训练通过在 robots.txt 中发布偏好来发挥作用。仅针对广告的偏好无法以这种方式表达:Cloudflare 可以检测哪些页面投放广告,但该列表太大且变化太频繁,无法在 robots.txt 中逐一列出。这就是为什么没有“在有广告的页面上禁止 AI 训练”。

代理不会造成与混合用途爬虫相同的搜索可发现性取舍,而且互联网尚未有成熟的指令来向代理表达禁止偏好。目前,我们不为代理包含禁止设置。随着 ai-prefs 等标准成熟,我们将重新审视这一做法。

9 月 15 日有什么变化?

我们正在对 Bot Management 和 AI Crawl Control 进行以下更改:

屏蔽和在有广告的页面上屏蔽现在适用于混合用途爬虫,包括 Applebot、Bingbot 和 Googlebot,因此任一设置都会影响搜索和训练。要停止训练并保留搜索,请使用禁止 AI 训练。

“屏蔽 AI 机器人”将被弃用,转而采用更精细的搜索、训练和代理控制项。

Managed Robots.txt 将被弃用,转而采用 Bot Preference Sync。启用了 Managed Robots.txt 的客户将迁移到新系统。

禁止 AI 训练将成为某些新域名的推荐配置的一部分。

现有客户的偏好将按下文所述迁移到新控制项。

你需要做什么

几乎在所有情况下,什么都不用做。你当前的设置会自动延续。

如果你希望完全移除混合用途爬虫,现在必须明确说明。选择屏蔽。它将阻止 Applebot、Bingbot 和 Googlebot 访问你的网站——包括搜索。

从未配置过更精细控制项的网站所有者,将根据其旧版屏蔽 AI 机器人设置迁移到新设置:

对于此前配置过精细控制项的域名,我们将在新定义下保留其选择的实际效果。此前训练选择为屏蔽或在有广告的页面上屏蔽的,将迁移为禁止 AI 训练。

对新域名的建议

从 9 月 15 日开始,注册新域名的客户将根据网站是否通过广告赚钱,获得两种预设配置之一。广告收入取决于人类实际看到页面。训练用答案取代了那次访问;代理抓取页面时没有人在那里看广告。因此,广告支持网站的预设更为严格。你可以在注册过程中或之后随时更改这些设置中的任何一项。

新域名的推荐设置

这对特定混合用途爬虫意味着什么?

Applebot、Bingbot 和 Googlebot 是 Accountable 的。Apple、Google 和 Microsoft 承诺遵循相同的发布者选择与透明原则。在禁止 AI 训练下,它们可以继续为搜索爬取你的网站。选择屏蔽则会完全阻止它们。

我们还将 Amazon、Anthropic、Meta 和 OpenAI 的相关爬虫归类为 Accountable。这些组织将搜索和训练爬虫分开,因此 Cloudflare 可以阻止训练爬虫而不影响搜索。

Applebot

Applebot 允许网站所有者通过在 robots.txt 中为“Applebot-Extended”添加 Disallow 规则来选择退出训练。网站所有者目前还可以通过页面 HTML 中的 nosnippet 指令表达对 AI 摘要的偏好。内容也可以标记为付费墙内容,以将其排除在生成式输出之外。Applebot 尚未提供 URL 级别检查工具。不过,我们已与他们的团队会面,他们分享了明年进行中解决方案的细节。Apple 还表示,禁止训练不会影响搜索排名。

Googlebot

Googlebot 允许网站所有者通过在 robots.txt 中为“Google-Extended”添加 Disallow 规则来选择退出训练,并且他们在网站管理员门户中提供了一个开关,可将网站内容排除在生成式搜索结果之外。Googlebot 还为网站所有者提供有关搜索结果和 AI 摘要结果的指标和报告。Google 分享了其现有和最近推出的控制措施的信息,以及他们已在开展的工作的信息,包括与 Google-Extended 相关的、面向网站所有者的额外 URL 级透明度工具,他们预计将在未来几周内推出。Google 还表示,禁止 Google-Extended 不会影响搜索排名。

Bingbot

Bingbot 在其 Webmaster Tools 中提供精细控制和透明度。网站所有者目前可以通过 Bing 的 NOARCHIVE meta 标签表达 AI 训练偏好。Microsoft 正在扩展这些能力,目前正在构建在域名/站点级别也尊重 robots.txt 中“禁止训练”偏好的机制,目标是在 2027 年初推出。对于希望今天就在 Bing 中选择退出训练的 Cloudflare 客户,除了使用 NOARCHIVE 标签外,网站所有者还可以使用屏蔽 URL 或内容移除工具。Microsoft 还表示,使用 NOARCHIVE 不会影响搜索排名。

在该支持推出之前,选择禁止 AI 训练不会通过 robots.txt 自动向 Bing 传达禁止训练偏好。这与之前的训练屏蔽设置的实际行为相同,该设置不适用于 Bingbot 等混合用途爬虫。

随着这些能力的发展,我们将继续联系并与所有 AI 爬虫运营方接触。Cloudflare Radar 公开跟踪 Accountable 爬虫运营方提供的控制、透明度和报告。

让互联网变得更好需要双方都有自主权:爬虫需要访问开放网络,而创建这个网络的人需要对他们的作品如何使用拥有有意义的控制权。今天的公告代表着朝着这种平衡迈出的具体进展。

进展需要基础设施提供商、内容创作者、技术公司和标准机构(如互联网工程任务组 IETF)共同努力,将这些原则转化为开放、可互操作的标准。

下一步:AI 摘要

训练和 AI 摘要给网站所有者带来了不同的问题。训练关注内容是否可用于构建 AI 模型。摘要影响人们如何发现、评估并最终访问一个企业。两者都很重要,但它们以不同方式影响企业。

选择退出 AI 摘要的控制是第一步。被认定为 Accountable 的运营方要么提供、要么正在完成提供该能力的工作,从而建立了一个重要基线:网站所有者可以说“不”。

但在全站范围内选择允许或禁止摘要仍然是一种粗放工具。正确的决定取决于网站、内容和业务结果。对于发布者而言,训练引发了关于控制、补偿和原创内容可持续性的根本问题。摘要则创造了一个单独且往往更直接的发行问题:有人访问发布者的网站,还是在搜索或 AI 体验中消费答案?对于许多其他企业而言,AI 摘要越来越多地处在潜在客户和网站之间。它们可能回答问题、比较替代方案、推荐产品,或帮助某人决定是否访问。

数据说明了混合影响。超过一半的消费者会阅读搜索中的摘要,而这些消费者在阅读摘要后结束搜索的可能性高出 40% 以上。这可能减少网站获得的访问量。但由 AI 搜索引荐的消费者转化率是传统搜索引荐者的三倍到五倍以上。AI 可能产生更少访问,却送来意图强得多的客户。

这本身无所谓好坏。靠广告资助的发布者可能优化受众规模。零售商可能更喜欢更少但更可能购买的访客。Cloudflare 的角色不是替他们选择,而是提供做出明智决定所需的可见性和控制。

摘要选择退出是一个强有力的开始,但不是最终状态。我们的下一个重点是帮助网站所有者理解摘要如何影响他们的业务,并让他们更好地控制自己的内容可以被使用多少。ai-prefs 等开放标准将是实现这一目标的重要部分。

如果你想在这场对话中发声,或提供反馈,请联系 crawlercontrols@cloudflare.com。

这些新控制项面向所有客户、所有套餐提供,并可在域名(区域)安全设置中配置。还没使用 Cloudflare?免费开始,立即设置你想要的流量控制。

来源:Cloudflare安全技术;原文日期:2026-09-15。内容经中文翻译改写,请以原文为准。

(责任编辑:数字安全观察)

相关内容
  • 美国陆军称曾掌控黑夜如今须掌控电磁频谱
  • 苹果收紧Mac完全磁盘访问权限,Agent面临用户信任门槛
  • Liquid交易所4200枚比特币仅剩200枚,白帽说法可信吗
  • Cisco邮件网关9.8分漏洞遭在野利用,一封邮件即可获取root权限
  • 红队两周任务AI十小时完成 全球首例多智能体勒索攻击实录
  • 保护组织免受AI辅助高管冒充和发票欺诈
  • 公交站牌被控沦为肉鸡 公安部通报揭示物联网安全风险
  • 黑客未窃取密钥,Bitget如何一夜损失3.5亿美元
推荐内容
  • 揭示EvilTokens:探究设备代码钓鱼的根源
  • 受保护的快速隧道:为你的下一个开发项目提供简单的无账户认证
  • 兼顾搜索可见性与禁止AI训练
  • 互联网邮件服务器未认证命令注入漏洞CVE追踪
  • MCP Python SDK曝出高危OAuth漏洞,AI Agent账号面临劫持风险
  • 为智能体时代重塑 Microsoft Defender 安全运营中心