Cloudflare新规能改变AI数据获取乱象吗?

最严厉的「爬虫政策」
Cloudflare对AI爬虫的分类
Cloudflare将AI爬虫分为三类。“Search”为搜索建索引的传统爬虫,如Googlebot。“Agent”是代用户访问网页的AI代理。“Training”用于模型训练的爬虫。网站主可分别设置对其“允许”或“屏蔽”,这一分类直接影响了像Google这样的公司。
Google面临的问题
Google的Googlebot是混合爬虫,既为搜索建索引,也为AI功能采集数据。网站为在Google搜索可见,不得不让Googlebot进入,这导致AI训练数据被一并拿走,Cloudflare新规旨在打破这种“捆绑”。

“最严规则优先”原则
若爬虫同时执行搜索和训练功能,适用规则按最严格的来。比如屏蔽Training爬虫,Googlebot等混合爬虫也会被屏蔽。数据显示搜索引擎时代的“爬取与回流比”在AI时代已失衡。
从「保安」到「收银员」
收费模式的转变
Cloudflare从去年的“PayPerCrawl”升级为“PayPerUse”,当内容在AI系统产生价值才收费。目前与Ceramic.ai和You.com合作,出版商内容被使用时可获付款,大出版商对此表示支持。
Cloudflare的角色争议
Cloudflare自己发布过爬虫API,曾出现出版商屏蔽其爬虫无效的情况。它既是规则制定者、执行者,又是市场参与者,构建了以自己为枢纽的“AI内容税收站”。
普通人能分到蛋糕吗?
大出版商与小创作者的差异
支持Cloudflare的多是大型出版商,它们有能力与AI公司签许可协议。而个人博主等小创作者,虽理论上可借Cloudflare设定权限获补偿,但目前合作伙伴少,且屏蔽爬虫可能减少曝光机会。
流量与收入损失
AI聊天机器人引荐流量少,用户点击引用来源概率低,出版商因AI搜索功能损失大量流量和收入。即使“PayPerUse”铺开,付费规模可能也难补损失,这更像是一次止损。
Cloudflare对AI爬虫的新规引发诸多关注。它虽将数据掠夺拉到明处,但中小创作者受益有限。随着“收费站”向基础设施层转移,未来互联网内容权益分配仍充满变数,各方利益博弈将持续。

相关问答
Cloudflare为什么要对AI爬虫分类管理?
为规范AI数据获取,Cloudflare将AI爬虫分类,让网站主能分别设置权限,打破如Googlebot这种混合爬虫带来的“捆绑”问题,明确数据使用规则。
“PayPerUse”模式是怎样的?
这是Cloudflare推出的收费模式,当网站内容在AI系统中产生价值,如出现在搜索结果或被用于生成回答时,网站主才能收到钱,目前有两家小合作伙伴。
Cloudflare新规对小创作者有什么影响?
小创作者理论上可借Cloudflare设定权限获补偿,但目前合作伙伴少。屏蔽爬虫可能减少曝光机会,且付费规模可能难补因AI搜索功能损失的流量和收入。
Google在Cloudflare新规下会面临什么挑战?
Google的Googlebot是混合爬虫,新规下若网站屏蔽Training爬虫,Googlebot也会被屏蔽,其获取网页内容的方式将受限,可能影响搜索和AI功能的数据采集。
互联网“收费站”转移是怎么回事?
过去二十年Google主导搜索流量,现在Cloudflare在基础设施层设规则,要求过路者说明用途并按规矩来,“收费站”从搜索引擎转移到了基础设施层。
Cloudflare新规能彻底解决AI数据获取乱象吗?
不能。Cloudflare管理部分网络流量,AI公司可转向非Cloudflare站点采集数据,且Google和Apple等可能绕过拦截,所以无法彻底解决乱象。

