科技

Cloudflare新设置:拦AI抓取但保搜索,站长怎么选?

37分钟前 33 阅读 来源:非常在线 作者:苏木
苏木
苏木 通信与 5G/6G 观察

Cloudflare推出“Disallow AI Training”设置,允许搜索引擎爬取同时拒绝AI训练,苹果、谷歌、微软已承诺支持。站长启用后可能影响搜索排名,但也不必过度担心,默认设置对多数站点无影响。本文帮你判断该不该用、何时用,以及如何平衡SEO与AI内容保护。

非常在线9月16日消息,Cloudflare昨日宣布推出新设置“Disallow AI Training”,允许管理员继续接受搜索引擎爬取,同时拒绝网站内容用于AI训练。苹果、谷歌和微软已承诺遵守该设置,这意味着站长可以更精准地控制网站内容的AI使用权限,而不会影响搜索结果收录。对于长期关注内容被AI“白嫖”的网站运营者来说,这无疑是一个值得留意的新选项。

Cloudflare新设置:拦AI抓取但保搜索,站长怎么选?

该设置的核心在于区分搜索引擎爬虫和AI训练爬虫。启用后,Cloudflare仍会允许那些同时用于搜索和AI训练的“混合爬虫”抓取内容,但前提是它们被标记为“Accountable”(可问责),其他纯AI训练爬虫则会被拦截。换言之,只要爬虫明确标识用途并接受监督,就可以继续访问你的网站;反之则会被拒之门外。Cloudflare表示,对于大多数客户,无需进行任何更改,默认情况下的设置就能正常工作。此前在Training中选择“Block”或“Block on pages with ads”的网站,会自动迁移至“Disallow AI Training”模式,也就是说,之前你手动配置过阻止AI训练,那么新设置会自动将你的选择延续下来,省去重复操作的麻烦。

需要特别留意的是,Cloudflare官方提醒,拦截这类AI爬虫有可能影响网站搜索排名。因为有些AI训练爬虫和搜索引擎爬虫是同一家公司的产品,比如Google-Extended。虽然该设置允许搜索引擎爬取,但如果爬虫请求同时带有AI训练目的,站长只能选择放行或拦截,无法细化到“让谷歌搜索爬,但不能让谷歌的AI训练爬”。这种“一刀切”在与搜索引擎的合作关系中可能带来不确定性,尤其是当搜索引擎将AI训练数据视为其核心业务的一部分时。所以,启用前你得权衡利弊:你是更在意网站内容不被AI无授权使用,还是更担心搜索收录量下降、流失自然流量?

实际上,Cloudflare这次是补上了一个行业漏洞。此前,网站站长虽然可以通过robots.txt协议禁止某些爬虫,但AI公司通常不遵守或不完全遵守,尤其是那些“混合爬虫”很难被准确识别。Cloudflare的新设置利用其广泛的服务器和域名信誉系统,给可信任的爬虫打上“Accountable”标签,才算真正把控制权还给了站长。不过,这项拦截也不是银弹,Cloudflare之外的圈子仍然需要依靠搜索引擎自己的规则,例如谷歌将在未来几周内推出面向Google-Extended的URL层级透明度工具,让站长一眼看清某个URL是否可能被用于AI训练;苹果也在开发自己的类似工具;微软则计划到2027年初才会在robots.txt中完全支持拒止AI训练。也就是说,短期内跨平台的AI爬虫拦截标准并不统一,别指望一个设置就能彻底解决所有AI抓取问题。

对于普通网站的站长或博客写手而言,这个功能最直接的价值是给了你一个“不同意被AI训练”的明确选项,而且几乎没有成本。假设你是一个靠SEO赚钱的站长,那你可以选择先观望,等谷歌和Cloudflare的兼容工具逐步落地后再决定,避免突然截断搜索引擎爬虫影响收录。如果你管理的网站上有很多原创攻略、评测或技术文档,且高频被AI工具直接引用而带来不了流量,那就可以毫不犹豫地开启“Disallow AI Training”,防止内容成为大模型的免费训练料。但如果你是靠“AI问答引用”获得曝光的网站,比如某些比价站或百科类内容,那么拦截AI爬虫反而会切断新流量入口,需要冷静核算。

适合用这个功能的人,包括:独立博客作者、中小内容站点、以及需要保护图片、文本等原创素材的创作者。第二个明显受益者是那些受广告分成影响的内容平台,因为它们在页面有广告时需要拦截AI抓取(Cloudflare老用户多数就是这拨人)。不适合的人,主要是依赖搜索引擎自然流量的电商站、论坛或UGC社区,因为AI搜索和传统搜索正在融合,强行划界可能让你失去和对手竞争的直接入口。建议持续关注Cloudflare后续的分直文档和各个搜索引擎的动态。像谷歌的URL层级工具刚推出时,很可能有不透明之处,站长不妨等一两周后再上看反馈,再迁移配置。另外,如果你之前已经手动编辑过robots.txt来封禁AI爬虫,请注意Cloudflare设置并不会自动覆盖本地文件,冲突权限可能会让你的网站在更新后“既不完全放行为搜索,也不完全拦截AI”,出现抓取矛盾,这时你最好用一个账号运维团队进行调整。总之,这个新设置不是可买可不买的东西——它是免费的,关键到底要不要开启,取决于你的内容是否有“内容质量溢价”或“流量杠杆”属性。你可以先小范围试点:把子域或少数URL设为“Disallow AI Training”,观察一下对应关键词排名和AI引用频次的变化,再用数据说话。说到底,平衡内容保护与公开获取,依然是一道管理决策题,而不是纯技术问题。

分享 微信二维码

相关推荐

更多 →