CCBot(CCBot)

AI 爬虫爬虫 —— 开发商、用户代理 UA 与 robots.txt 拦截方法

CCBot AI 爬虫
开发商
Common Crawl
用户代理
CCBot
通过 Robots.txt 拦截
User-agent: CCBot
Disallow: /
把以上片段加入网站根目录的 robots.txt 即可要求该蜘蛛停止抓取全部页面(需改为只拦某个目录,把 Disallow: / 换成对应路径)。 注意:CCBot 抓取的内容用于 AI 模型训练与问答,不参与搜索引擎收录,拦截它不影响你在搜索结果中的排名;如不希望站点内容被用于 AI 训练,建议直接按上方片段拦截。

详细介绍

CCBot 是 Common Crawl 基金会的爬虫,其抓取的网页数据被公开为免费语料库,是许多大模型训练数据的来源之一。

如不希望内容进入公开语料库,可用 User-agent: CCBot 拦截。
💡 本篇收录于搜索引擎蜘蛛大全」, 配合「网站日志分析工具」可自动识别该蜘蛛在日志中的访问与抓取页面。

同类蜘蛛推荐