实测

实测:为 AI 搜索改造官网三周,
境外引擎没来、国内通道才是主场

llms.txt、结构化数据、显式放行 AI 爬虫——改造三周后翻开服务端日志:境外 AI 引擎零到访,国内引擎里搜狗爬虫却来了 46 次。对服务中国客户的企业,投入优先级该反过来。

浩瀚数据晟财 · 数据咨询团队 发布于 2026-10-06 更新于 2026-10-08 阅读约 9 分钟

先给结论:境外零到访,国内在动

我们的官网在 9 月中旬上线时就按「AI 搜索友好」改造过:站根加了 llms.txt,每篇内容页补了结构化数据,robots.txt 里显式放行了一批 AI 爬虫。到 10 月 5 日差不多三周,翻开服务端日志,结果和预期不一样。

第一个意外:境外 AI 引擎爬虫基本零到访。meta-externalagent 全期 10 次(近 7 天 2 次),是唯一有实质收录行为的境外机器;近 14 天里 GPTBot、OAI-SearchBot、ChatGPT-User、ClaudeBot、PerplexityBot 都没有真实抓取。

第二个意外更重要:国内引擎其实一直在动,只是我们一开始漏看了。全期日志里 Sogou web spider 出现 46 次,是全站最活跃的搜索引擎爬虫;Baiduspider 渲染版与 360Spider 也各有记录。而我们改造时把八个境外爬虫写在放行清单最前面,国内只放了三个——优先级写反了。

对一家服务中国 B 端客户的国内站点,真实的 AI 搜索战场在豆包、元宝、文心、通义千问、Kimi、DeepSeek,不在 ChatGPT 和 Claude——后者在大陆不提供官方服务,国内客户根本用不上。优化 GPTBot 的收益,远低于在微信公众号上多写一篇能被元宝收录的文章。

先别急着得出「AI 搜索没用」的结论。这份实测真正能说明的是:AI 搜索的收录是慢变量,且国内引擎的通道结构完全不同——有的靠爬虫,有的根本不靠爬虫。正确的投入顺序不是「先折腾技术」,而是先分清每个引擎靠什么吃饭,再把内容放到它的通道上。

我们改了什么:一张改造清单

不绕弯子,先把改造动作摊开,便于你对照自己的站点。

层级具体做法想解决的问题
技术层robots.txt 显式放行国内与境外 AI 爬虫并声明 sitemap;国内爬虫段排在最前(DoubaoBot、Bytespider、DeepSeekBot、KimiBot、Kimi-SearchBot、QwenBot、TongyiBot、Baiduspider/-render、Sogou web spider)排除「是不是我没允许」这个变量——不少模板站和外包站的 User-agent: * 下面挂着一串 Disallow,会连带挡住 AI 爬虫
结构层每篇内容页固定 3 个结构化数据块(面包屑、文章、FAQ 问答),全站统一 canonical 与社交分享标签让机器知道这是谁写的、属于哪个栏目、正文在哪、有哪些问答对
摘要层站根放一份 llms.txt:一页写清公司做什么、服务谁、哪些文章可引用给 AI 一份「拿来即用」的企业摘要,而不是让它从零猜
内容层每篇只讲一个判断,前 200 字给结论,数字用表格列清,问答对写进正文AI 引用的是句子,不是版式;问答对是最容易被原样摘录的形态
性能层全静态页面、无登录墙、正文不依赖 JavaScript 渲染抓取成本低,机器才愿意多抓几页
生态层同一篇内容同步进微信公众号(服务号 + 订阅号)元宝、微信搜一搜的主要答案池在微信生态内部,这条通道爬虫管不到——见第五节

三周实测:爬虫日志里的真实名单

数据来自官网自建服务端记录(不接第三方统计脚本)。窗口取 2026-09-28 至 10-05 的近 7 天,并对照近 14 天与全期记录。全期累计留下 244 个访问身份、1112 条访问事件(含爬虫与自家访问)。

近 7 天全站 41 个访客 / 118 条事件,判定为爬虫的是 13 个访客 / 13 条事件,占 11%;按 UA 去重后,爬虫只有 3 个。

UA 标识归属 / 通道记录判读
Sogou web spider/4.0搜狗 → 微信搜一搜 → 腾讯元宝的外部搜索补充全期 46 次全站最活跃的搜索爬虫。搜狗是腾讯系,为元宝补长尾内容——这条线我们此前完全没关注
meta-externalagent/1.1Meta(境外)全期 10 次,近 7 天 2 次抓过 4 篇洞察长文 + 首页、联系、区域、隐私等;节奏平稳,属正常收录
Baiduspider(渲染版)百度搜索 → 文心一言(内嵌百度 App)近 14 天 1 次正确通路。文心内嵌于百度 App,百度资源平台的索引量就是文心的数据源基础——值得重点经营
360Spider360 → 纳米搜索近 14 天 1 次正常,低频
HeadlessChrome/146—7 次(7 个访客各抓 1 次首页)链接预览 / 可用性监控类,不进任何索引
HeadlessChrome/154—4 次(集中在 6 秒内)我们自己的上线验证脚本——已核对本地构建产物确认
DoubaoBot / Bytespider豆包(字节)0零记录。豆包的新站首次到访通常 1–3 天,三周零记录需要主动排查(见第六节清单)
DeepSeekBot / KimiBot / QwenBot / TencentBotDeepSeek / Kimi / 通义 / 元宝0零记录。注意:这四家未必都有独立爬虫——没有记录不等于没收录,见第五节
GPTBot / OAI-SearchBot / ChatGPT-User / ClaudeBot / PerplexityBot境外 AI近 14 天 0(真实抓取)零记录,且国内客户也用不上这些产品——优先级最低

把「没来」和「被拦」分开看很重要。我们同时核对了 robots.txt 返回 200、AI 允许段完整、sitemap 声明在位——不是被拒绝,是还没来。新站收录本来就按月计,爬虫的抓取频率又显著低于传统搜索引擎,三周零记录对低频引擎属于正常范围。

另有一组值得记录的辅助数据:全期 robots.txt 被请求 1046 次、sitemap.xml 被请求 349 次、llms.txt 被请求 66 次。llms.txt 的请求方包括 AhrefsBot、Googlebot 以及真实抓取过/llms.txt 的 GPTBot 请求——说明这份文件确实被机器读取,不是摆设。

五类日志判读陷阱(含伪装成 GPTBot 的扫描器)

这一节是本文最想补充的部分。我们第一次做日志统计时,把「UA 里出现 GPTBot」直接当成了「GPTBot 来了」——这是错的。按 UA 做全期检索,GPTBot 相关请求有 352 条,但逐条看内容,绝大多数不是收录行为:

陷阱现场特征怎么识别
① 伪装成 AI 爬虫的漏洞扫描器同一 IP(如 34.38.159.35)在一秒内请求 /.git-credentials、/api/.env、/graphql、/.aws/credentials.old、/_profiler/phpinfo,全部 404;UA 在 GPTBot/1.2 与 1.4 之间随机切换,还轮流伪装成 Mac / iPhone / Ubuntu / Windows / Android 五种客户端真正的 AI 爬虫不会去摸 .env 和凭据文件。看请求路径——正常收录抓的是页面,扫描器抓的是敏感文件
② 预览 / 监控类无头浏览器HeadlessChrome 连续两周出现,每次只抓一次首页,时间散布在六天里只抓首页、不深入内链、不进任何索引
③ 你自己4 次抓取发生在 6 秒内、目标全是当天刚上线的新页面与上线时间高度重合、节奏急促——本站在全期事件中自家访问常年占 43%~56%
④ 低频引擎被误判为「没来」Baiduspider-render、360Spider 近 7 天都是 0低频引擎的观察窗口不能取 7 天,至少看 14 天或全期
⑤ 生态内流量,日志里根本看不见元宝、豆包、文心的部分信源来自生态内部内容(公众号、头条号、百家号),不经过你的服务器这类收录在服务端日志里永远不会出现。日志为 0 不等于没被收录——这是最容易得出错误结论的一类

所以判读日志的正确姿势是三步:先按请求路径剔掉扫描器,再按节奏剔掉预览与自家,最后把「生态内通道」单独拿出来看。只看 UA 名字统计次数,得到的结论大概率是错的。

关键修正:国内 AI 引擎的信源通道不等同于爬虫

这是本文最初版本最大的盲区。国内 AI 引擎的信源结构差异极大,不能像对 Googlebot 那样,只靠改 robots.txt 和观察爬虫日志来推进。按公开资料与实测,大致分三类:

引擎主要信源通道对我们意味着什么
文心一言(百度)百度系生态:百度搜索索引 + 百科 + 知道 + 百家号爬虫可触达(Baiduspider / -render)。百度资源平台的收录量就是文心的数据源基础,同时百家号内容是更高权重源
腾讯元宝微信公众号(公认权重最高)+ 视频号 + 微信搜一搜 + 腾讯新闻,外部靠搜狗补长尾公众号是元宝的独家资产,爬虫管不到微信生态内部。开门方式是「把内容发进生态」,不是改配置。这也解释了为什么搜狗爬虫在我们站上很活跃,但元宝未必会因此推荐我们
豆包(字节)字节系生态:抖音、今日头条、西瓜视频为主;DoubaoBot / Bytespider 有公开爬虫爬虫可触达,且是少数有公开 UA 的国内 AI 爬虫。新站首次到访通常 1–3 天;若 7 天仍无记录,应排查 robots / sitemap / WAF
通义千问(阿里)阿里生态:淘宝商品库、高德、支付宝、本地生活为主;无独立公开爬虫 UA(主要复用第三方索引)日志零记录不代表没收录。B 端专业服务问题不是它的主战场,优先级相对低
Kimi(月之暗面)聚合第三方索引(搜狗等)+ 知乎等平台;有 KimiBot / Kimi-SearchBot 且官方公开了爬虫政策页国内唯一公开爬虫政策的厂商,明确遵循 robots.txt。屏蔽 Kimi-SearchBot 等于从 Kimi 搜索结果里消失,务必放行
DeepSeek技术社区(CSDN / 知乎 / GitHub)+ 权威媒体;有 DeepSeekBot极度偏好长文技术内容,对纯营销页几乎不抓。三周零记录属常见;引导到访的有效方式是在技术社区发深度文章并在文末带官网链接

这张表推翻了我们最初的假设。改造三周里我们把主要精力放在 robots.txt 放行境外爬虫和补 llms.txt 上,而对真正影响国内客户触达的两件事做得最少:一是把内容同步进微信公众号(元宝通道),二是在百度系生态里建立占位(文心通道)。日志告诉我们「谁来过」,但决定不了「客户在 AI 里能不能搜到我们」。

另需说明一个通用事实:国内大模型获取信息并不全靠实时爬虫,部分回答来自训练数据预喂——这部分 robots.txt 管不到,也不产生日志。因此「日志为零」与「在 AI 回答里被引用」之间,隔着好几层,不能直接划等号。

该做什么:国内优先的 AI 搜索准备清单

按优先级排。前三项和爬虫没有直接关系,但它们决定「爬虫来了以后有没有东西可拿走」。P1 的排序按信源权重来:国内通道优先,境外通道最后。

优先级动作判断标准
P0 内容每篇只讲一个判断,前 200 字给结论把文章给一个没有背景的人,他能在 30 秒内说出「所以呢」
P0 结构结论、数字、边界写成独立段落和表格,不要塞进图片里摘出任一段落,语义完整、不依赖上下文
P0 可信每个数字写清来源与统计边界引用者敢用——AI 越来越倾向引用带口径的数字
P1 生态把内容同步进微信公众号(服务号 + 订阅号),必要时补百家号、头条号元宝的主要答案池在微信生态内部、文心看重百家号——这类通道爬虫管不到,只能靠「把内容发进去」
P1 入口robots.txt 显式放行国内 AI 爬虫(DoubaoBot、Bytespider、DeepSeekBot、KimiBot/-SearchBot、QwenBot、Baiduspider/-render、Sogou)并声明 sitemap三分钟能做完,把「有没有被允许」这个变量排除掉。国内段写在前面,境外段保留在后
P1 摘要站根放一页 llms.txt 企业摘要一屏说清你是谁、做什么、哪些内容可引用
P2 百度生态经营百度资源平台:提交 sitemap、看索引量百度索引量是文心的数据源基础,比盯爬虫日志更接近结果
P2 度量把爬虫、自家、真人分三档统计;低频引擎看 14 天以上不分档、窗口太短,你连基线都没有,也就无法判断「有没有变好」
P3 境外顺带放行境外 AI 爬虫有出海业务才值得投入精力;纯内销站点放行即可,不必专门优化
P4 禁忌不要给 AI 爬虫做特供页或隐藏文本一旦被判定作弊,损失远大于收益

站点有几十上百页时,落地顺序建议是:先改 5 篇最有判断力的文章 → 再把内容同步进微信生态 → 然后补 robots 与 llms.txt → 最后建度量分档。反过来做(先折腾技术、内容照旧)是我们见过最常见的空转,也是我们自己这三周踩过的坑。

本文要点

  • 境外 AI 引擎爬虫零真实到访;国内引擎里 Sogou web spider 全期 46 次最活跃,Baiduspider-render、360Spider 各有记录
  • 国内爬虫并不都靠爬虫:元宝靠微信公众号、文心靠百度生态与百家号、豆包靠字节生态——生态内通道爬虫管不到,日志也看不见
  • 日志里有五类陷阱:伪装成 GPTBot 的漏洞扫描器(352 条 GPTBot 记录里绝大多数是扫描)、预览机器人、你自己、低频引擎、生态内不可见流量
  • 辨别真假爬虫的关键是看请求路径:真爬虫抓页面,扫描器摸 .env、.git-credentials
  • 投入顺序(国内优先):先写好内容 → 同步进微信生态 → 补 robots 与 llms.txt → 建度量分档

这份实测不能说明什么

把边界写在明处,这份数据的价值才站得住。

  • 样本极小:1 个站点、3 周、十余次爬虫事件。它能作为「新站慢热」的一个观察点,不能外推成行业规律。
  • 只能看到抓取,看不到引用。AI 回答里到底引用了谁,属于另一套观测体系,本文回答不了。
  • 日志为零 ≠ 没被收录。国内多家引擎无独立公开爬虫、且部分内容来自生态内或训练数据预喂,这些都不产生服务端日志。
  • 三周零记录 ≠ 永久零记录,也不等于 AI 搜索渠道无效——只说明收录周期长于我们最初的预期。
  • 文中各引擎的信源通道描述,来自公开资料与实测的交叉印证,各平台策略会变,建议每季度复核一次。
  • 结论对内容型站点更适用;工具站、电商站的抓取动机与路径不同,不能直接套用。

我们会继续按周巡检爬虫日志,后续变化在《生长日记》系列里继续公开。

常见问题

国内 AI 引擎需要单独配置吗?境外爬虫放行了是不是就够了?

不够,而且优先级应该反过来。境外引擎(ChatGPT、Claude、Perplexity)在大陆不提供官方服务,国内客户实际用不上;真正决定客户能不能搜到你的,是豆包、元宝、文心、通义千问、Kimi、DeepSeek。更关键的是这些引擎的信源结构完全不同:豆包有公开爬虫(DoubaoBot / Bytespider,值得放行)、文心依赖百度生态与百家号、元宝主要靠微信公众号(生态内,爬虫管不到)、通义千问无独立公开爬虫。所以正确做法是:robots.txt 里国内段写在最前面并补全缺失项,同时把内容同步进微信公众号等生态渠道。

日志里出现 GPTBot,是不是说明 ChatGPT 已经收录我们了?

不一定,而且经常不是。我们在全期日志里检索到 352 条含 GPTBot 的请求,逐条看内容后发现绝大多数是漏洞扫描器在冒用这个 UA:同一 IP 一秒内请求 /.git-credentials、/api/.env、/graphql,全部 404,UA 还在 GPTBot/1.2 与 1.4 之间随机切换、并伪装成五种不同客户端。真 GPTBot 只抓公开页面,不会去摸凭据文件。判别方法很简单:看请求路径——是页面就正常,是敏感文件就是扫描器。

robots.txt 里要不要显式写 Allow?

建议写,而且国内爬虫段要写在前面。在默认规则下,不禁止通常等于允许;但如果站点的 User-agent: * 下面挂着一串较宽的 Disallow(不少模板站和企业站都有),AI 爬虫会被连带挡住,而你不会收到任何提示。显式放行的成本是三分钟,收益是排除掉一个变量。注意敏感目录(后台、内部工具页)与图片资源的限制仍要保留。

llms.txt 真的有用吗,AI 会读吗?

目前是自愿标准,没有哪家厂商承诺一定读取。但我们的日志显示它确实被机器读取——全期 66 次请求,来源包括 AhrefsBot、Googlebot 等。我们的判断是:成本极低,价值双份——会读它的爬虫拿到的是一份规整摘要,不读它的对象(包括人)也会把它当企业简介页看。所以按「企业摘要页」的标准去写,即使 AI 不读,这笔投入也不亏。

怎么判断日志里的爬虫是不是自家的?

三个筛子。第一是 IP 段:把公司出口 IP、服务商预取网段、监控探针登记成白名单,先剔除。第二是时间形态:自家脚本常集中在部署后几分钟内,且目标全是刚上线的新页面。第三是 UA 特征:无头浏览器标识(如 HeadlessChrome)在自家自动化里出现得很频繁。三筛子过完,剩下的才值得当外部爬虫来分析。

多久能看到 AI 搜索带来流量?

按这份实测,三周远远不够。可观测的最早信号不是流量,而是爬虫日志里第一次出现 AI 厂商的 UA;之后是「被引用」,最后才是「有流量」。建议以季度为观察单位,这个顺序跳不过去——急着看流量,只会得出错误的结论。另外要接受一个现实:国内部分引擎的收录过程在服务端永远看不到日志,只能通过「在 AI 里实际提问、看有没有引用你」来反向验证。

宋运奎 — 浩瀚数据晟财创始人
宋运奎
浩瀚数据晟财 · 创始人 / CEO
原小米之家数据负责人国际数据和人工智能管理协会中国分会理事中国电子信息行业联合会数据治理专委会委员工信人才大模型应用创新与数据要素高级人才

原小米新零售小米之家数据负责人,主导搭建业内领先的智能数据体系;曾任金山软件核心数据产品负责人,主导研发业内最早的移动端数据产品 KBOSS 平台。专注 AI 场景化应用与企业数据资产化运营,本文由其主笔并负责内容审核。

RELATED · 相关阅读

继续往下看

生长日记

官网上线 16 天:76 次文章阅读告诉我们,客户案例没人看

我们把 13 篇文章 16 天的全部阅读数据按类型摊开排序:花功夫最多的客户案例,篇均只有 2.7 个人看、停留 15 秒、看完继续逛官网的比例是 0。而一篇自曝家底的数据复盘,读者平均读了 5 分半。这篇文章讲清楚为什么,以及我们决定怎么改。

你们的官网,在国内 AI 里搜得到吗?

我们做三件事:给现有官网做一次 GEO 可引用改造(内容结构 + 结构化数据 + llms.txt)、按国内引擎的信源通道补齐放行与生态分发、搭一套分档流量统计让「AI 到底有没有来」有数字可查。可以先从一次抓取诊断开始。

聊聊 AI 搜索准备 联系我们