先说结论:六条通道,不是一个开关
先给结论:在豆包和元宝里搜不到自己,多数不是「AI 没抓到我」,而是你把六条各自独立的通道当成了一个开关。国内六大 AI 引擎获取企业信息的路径分三类:有的靠自己的爬虫(改 robots.txt 就能开门),有的只在自家生态里收录(爬虫怎么写都没用,得把内容发进去),有的根本没有独立公开爬虫(只能等上游索引收录)。只修一类,等于白做。
一个很典型的场景:企业把官网的 robots.txt 改了、加了 sitemap、补了结构化数据,然后设了个日历提醒,一个月后打开豆包和元宝,输入自己公司名——还是那几条两年前的旧信息,甚至什么都没有。于是得出两个常见结论:「AI 搜索是噱头」或者「我们内容不行」。
两个结论大概率都不对。真实的原因是:你把内容放在了 A 通道门口,而客户提问的答案来自 B 通道。元宝的答案池主要在微信公众号里,公众号内容在微信生态内收录,不经过你服务器上的 robots.txt,也不产生任何日志。你在自家站点上做的所有技术优化,对这条通道的作用是零——不是无效,是不相干。
技术优化解决「让爬虫能拿到」,生态分发解决「让答案池里有你」。这两件事不能互相替代,也不能用同一套动作完成。
本文把六条通道画成一张地图,并说明每一类各自该怎么开门。所有关于爬虫标识、收录机制的描述,我们尽量标注来源与可信度等级,因为这块信息里第三方转述和实测数据混得比较厉害。
信源通道地图:三类通道一张表
先看全景。这张表是本文的核心,后面三节逐类展开。
| 引擎 | 通道类型 | 关键标识 / 通道 | 你要做什么 |
|---|---|---|---|
| 豆包(字节) | ①+② 混合 | DoubaoBot、Bytespider、imageSpider 等字节系爬虫;生态侧为今日头条、抖音、西瓜视频 | 修 robots + 提交头条搜索资源平台 + 开头条号/抖音企业号 |
| DeepSeek | ① 机器人可触达 | DeepSeekBot/1.0 | 放行 + 写深度长文(它对营销页几乎不抓) |
| Kimi(月之暗面) | ① 机器人可触达 | KimiBot(训练)、Kimi-SearchBot(搜索索引)、Kimi-User(用户触发实时访问) | 放行三兄弟,尤其不能屏蔽 Kimi-SearchBot |
| 通义千问(阿里) | ③ 无独立爬虫 | 早期 TongyiBot、现 QwenBot;另有夸克 QuarkSpider | 绑定阿里云搜索资源平台,靠夸克/上游索引间接进入 |
| 文心一言(百度) | ①+② 混合 | Baiduspider、Baiduspider-render(AI 搜索用渲染版);生态侧为百科、知道、百家号 | 提交百度搜索资源平台 + 同步百家号 |
| 腾讯元宝 | ② 生态内为主 | 微信公众号、视频号、微信搜一搜、腾讯新闻;外部靠搜狗补长尾 | 把内容发进微信公众号——没有技术替代方案 |
把这张表按「你能不能自己控制」重排,就得到下面三类。这也是排查顺序:先看属于哪一类,再决定要不要动技术。
| 通道类型 | 覆盖引擎 | 开门方式 | 能不能靠改配置解决 |
|---|---|---|---|
| ① 有公开爬虫 认 robots.txt | 豆包、DeepSeek、Kimi、文心(百度系)、通义(QwenBot 段) | 放行爬虫 + sitemap + 结构化数据 + 提交站长平台 | 能,分钟级到天级生效 |
| ② 生态内收录 爬虫管不到 | 元宝、豆包(部分)、文心(部分) | 把同一篇内容发进对应生态:公众号/视频号、头条号/抖音、百家号 | 不能,只能靠内容分发 |
| ③ 无独立公开爬虫 | 通义千问(主要)、部分引擎的网页版 | 先被上游索引收录(夸克、搜狗、百度等),再等它引用 | 不能,只能间接影响 |
三类的处理成本与见效速度完全不同:① 是技术活,一次性配置,但要等收录周期;② 是内容活,每篇都要做一遍,但见效最直接;③ 是耐心活,你能做的只有把内容做扎实、把上游索引经营好。把三件事混在一起谈「GEO 优化」,是大多数方案落不了地的根源。
第一类:有公开爬虫的,修配置就能开门
这一类是唯一能通过改站点配置直接影响的部分。逐个说清。
① 豆包 / 字节:有独立 UA,但要同时经营两个站点。字节系运营着不止一个爬虫,公开目录中可查到 Bytespider(训练与索引)、imageSpider(图片)、DoubaoBot(豆包)等,另有 TikTokSpider、Toutiao 等面向不同产品的抓取标识——第三方爬虫目录普遍记录字节旗下共有 8 个左右的 bot。需要提醒的是,另有第三方观察认为「豆包没有独立爬虫,主要通过检索字节系搜索库获取信息」,与爬虫目录的记载存在冲突;两种说法都指向同一个实操结论:与其争论 UA 存不存在,不如把内容同时放进头条搜索生态。
具体动作:到头条搜索资源平台(zhanzhang.toutiao.com)完成企业认证、验证域名、提交 sitemap;同时开通头条号与抖音企业号——豆包在回答企业相关问题时,字节系内容平台的权重明显更高。
② Kimi:国内唯一公开爬虫政策页的厂商,务必读一遍。这是六家里信息最透明的一家,官方政策页原文明确了三个爬虫的分工:KimiBot 用于模型训练;Kimi-SearchBot 用于构建搜索索引,官方原文写到「禁止该爬虫将使你的站点无法出现在 Kimi 搜索结果中」;Kimi-User 用于用户触发的实时访问,并特别说明「robots.txt 规则可能不直接适用」于它。
官方给出的管理建议也值得照抄:优先用 robots.txt 管理,而不是封 IP——因为 IP 段会变,封 IP 还可能导致它读不到你最新的 robots.txt。官方同时提供了三个爬虫各自的 IP 段 JSON 文件与 Crawl-delay 支持,联系邮箱 kimibot@moonshot.ai。
③ DeepSeek:有 UA,但抓取意愿受内容类型影响极大。其爬虫标识为 DeepSeekBot/1.0,完整 UA 形如 Mozilla/5.0 (compatible; DeepSeekBot/1.0; +https://www.deepseek.com/bot)。关于它是否遵守 robots.txt,不同来源口径不一致——部分爬虫目录标注为遵守,也有商业反爬服务商标注为不遵守。稳妥做法是按「会遵守」配置放行,同时不要指望它会来:它对官网营销页几乎没有兴趣,真正有效的方式是在技术社区发深度文章,并在文末带上官网链接。
④ 文心一言:走的是百度搜索的同一套索引。AI 搜索场景对应 Baiduspider-render(渲染版),它需要执行页面 JavaScript 才能拿到正文——所以正文依赖前端渲染的站点,在百度系里吃亏。实操入口是百度搜索资源平台:提交 sitemap、看索引量,索引量本身就是文心的数据源基础。
⑤ 通义千问的爬虫段:见下一节,它属于第三类,但 QwenBot 这个标识本身是公开的,可以一并放行。
这一类的最小动作清单(三分钟能做完):
- robots.txt 里把
DoubaoBot、Bytespider、imageSpider、DeepSeekBot、KimiBot、Kimi-SearchBot、QwenBot、Baiduspider、Baiduspider-render显式写 Allow,并声明Sitemap:。 - 确认没有在
User-agent: *下面挂一串较宽的 Disallow——这是最常见的事故来源,模板站和外包站尤其多。AI 爬虫被挡住时,你不会收到任何提示。 - 正文可被无 JS 环境读取(关键内容别只放在前端框架里渲染)。
- 提交 sitemap 到百度搜索资源平台与头条搜索资源平台。
第二类:只在生态内收录的,爬虫管不到
这一类是「在豆包和元宝里搜不到自己」最常见的真实原因。核心事实只有一句:这些内容在各自的生态内部被收录,不经过你的网站,也不产生你的服务器日志。
① 腾讯元宝 ← 微信公众号(嫡系通道)。元宝对微信生态的依赖是公开信息:App Store 上的官方描述写着「联网搜索公众号、视频号等优质腾讯生态信源」;腾讯通过人民网发布的官方供稿中提到,元宝打通了微信公众号、视频号及100 多个垂直领域权威生态信源。多个第三方来源(口径不一、需谨慎引用)给出的权重分布是:微信生态占相当大比例,其中公众号又是最重的一块。
这条通道对企业意味着什么?你发在公众号上的文章,是元宝答案池的一等公民;你发在官网上的文章,对元宝来说是生态外内容,需要额外绕道搜狗等外部搜索。而公众号内容进微信生态之后的收录与排序,由微信自己的机制决定,`robots.txt` 里写什么都改变不了。
实操:把内容中心的每篇文章同步发进公众号,且注意标题、正文、结论都要完整——只发一张海报或一段摘要,可被引用的信息量为零。有条件的话再补视频号,元宝对视频号同样有生态偏好。
② 豆包 ← 头条号 / 抖音。字节的逻辑与腾讯同构:豆包回答企业相关问题时,今日头条、抖音内容的权重明显高于站外网页。实操上,官网文章可以同时发一份到头条号;需要塑造企业实体认知的场景,可以认领或补充抖音百科词条,豆包的企业知识库也支持上传文档。
③ 文心一言 ← 百家号。百度系内部,百家号内容的权重高于普通网页。第三方流传的「百家号内容权重约为普通网页 1.5 倍」这类具体倍数,我们未能在一手来源中核实,建议只当方向性参考;可以确定的是百度官方一直把百家号作为重点内容生态在推。
这一类有一个共同的操作纪律:同一篇内容在不同生态里不要做「一稿多投的删减版」。AI 引用的是句子和判断,你砍掉的往往正是可被引用的那些结论段落。正确做法是按平台习惯调整标题与格式,但把核心判断、数字、边界完整保留。
第三类:没有独立爬虫的,只能等上游收录
这一类最容易被误判。日志里没有它的记录,你既不能确认它来过,也不能确认它没来——因为它根本没有以自己名义公开的爬虫。
通义千问(阿里)是典型:早期有 TongyiBot(UA 中带 x-robot-tag: TongyiBot 标识),当前官方文档记载的爬虫为 QwenBot,说明其尊重 robots.txt 且不执行 JavaScript。但通义的产品重心在阿里自有生态——淘宝商品库、高德、支付宝、本地生活——对 B 端专业服务类问题,它的外部内容覆盖相对薄。因此日志零记录不代表没收录,也代表不了什么。
实操上,你能做的只有间接动作:在阿里云搜索资源平台绑定已备案域名、提交 sitemap,让夸克(QuarkSpider)收录,再等通义引用;剩下的就是确保内容本身可被引用。
元宝网页版、豆包网页版的一部分回答同样属于这一类:它们调用上游搜索能力,不产生独立爬虫日志。判断某个引擎属于哪一类,有个简单办法:去它的官方文档或政策页找爬虫说明,找不到就把它归进第三类——别把「没找到记录」当成「没被收录」。
识别方法小结(也是本文最实用的一个动作):
| 你想知道 | 去哪看 | 结果怎么读 |
|---|---|---|
| 它是第①类吗 | 厂商官方文档 / 爬虫政策页(如 Kimi 的爬虫政策页) | 有明确 UA 与 robots 说明 → 第①类,去修配置 |
| 找不到官方说明怎么办 | 第三方爬虫目录(knownagents、Dark Visitors 等) | 有记录 → 按第①类处理但标注来源;无记录 → 归第③类 |
| 它是不是第②类 | 看这个引擎所属的生态(腾讯/字节/百度)有没有内容平台 | 有 → 第②类,把内容发进去;生态内通道日志永远为 0 |
| 它到底有没有引用我 | 亲自去那个 AI 里提问,看回答里的出处 | 这是唯一能验证第②③类结果的方法 |
企业自查清单:六个平台怎么逐个确认
把上面三类落成一张可执行的表。建议按顺序做,每格做完打个勾——六格都确认过,才有资格说「AI 搜索没用」。
| 引擎 | 第一步:确认通道类型 | 第二步:开门动作 | 第三步:怎么验证 |
|---|---|---|---|
| 豆包 | 查是否有 DoubaoBot / Bytespider 抓取记录 | robots 放行;提交头条搜索资源平台;开头条号、抖音企业号 | 豆包提问公司名 / 主营产品,看是否引用到你的内容 |
| 腾讯元宝 | 不必查日志——它主要看公众号 | 把文章同步发进微信公众号(服务号 + 订阅号),必要时补视频号 | 元宝提问,看回答是否引用了你的公众号文章 |
| 文心一言 | 查 Baiduspider-render 记录 | robots 放行渲染版;提交百度搜索资源平台看索引量;同步百家号 | 看百度索引量变化;文心提问核对出处 |
| 通义千问 | 假设无独立爬虫(第③类) | 阿里云搜索资源平台绑定域名、提交 sitemap;确保内容可引用 | 夸克搜一次;通义提问核对 |
| Kimi | 核对三爬虫标识 | robots 显式放行 KimiBot / Kimi-SearchBot,不要屏蔽 SearchBot | Kimi 搜公司名,看是否为「未收录任何内容」 |
| DeepSeek | 查 DeepSeekBot 记录 | 放行;把深度文章发到技术社区并在文末带官网链接 | DeepSeek 提问,看是否引用到第三方站点上的你 |
顺序建议:先做元宝那一行。原因很简单——它是六家里唯一「只要发内容就一定进入答案池」的通道,成本最低、确定性最高,也是企业最容易忽略的一格。
五个最常见误区
- 误区一:改完 robots.txt 就该有效果。robots.txt 只对第①类通道有意义,且它解决的是「允许不允许」,不解决「值不值得抓」。第②类通道面前,这份文件等于不存在。
- 误区二:日志里有记录就等于被收录。有记录只说明「抓过」,离「进了索引」和「被 AI 引用」还有两段路。反过来,没记录也不等于没收录——生态内通道和训练数据预喂都不产生日志。
- 误区三:发了公众号就会优先排名。进入答案池 ≠ 排在最前。公众号解决的是「有资格被引用」,能不能排到前面,取决于内容的可引用性:结论是否明确、数字是否带口径、段落是否独立成义。
- 误区四:所有国内引擎都有公开爬虫,只是我没等到。通义千问等属于第三类,你永远等不到它的爬虫记录。用「日志里有没有」判断「要不要做这个平台」,是方法上的错。
- 误区五:屏蔽 Kimi-SearchBot 无所谓。官方文档写得非常明确:禁止它将导致你的站点无法出现在 Kimi 搜索结果中。这类屏蔽经常是「为了省服务器资源」在模板里顺手加上的,代价却是在一整个引擎里消失。
我们的实测基线:为什么「等了一个月没动静」
上面这些结论不全是纸上推演。我们在自家官网(9 月中旬上线,改造后约三周)的服务端日志里做过一次普查,结果可以直接作为一条对照基线:
三周实测基线(自建服务端日志,不接第三方统计)
- Sogou web spider:全期 46 次——全站最活跃的搜索爬虫。搜狗是腾讯系,为元宝补生态外长尾内容,这条线此前我们完全没关注
- meta-externalagent(境外):全期 10 次;Baiduspider-render 与 360Spider:各 1 次
- 豆包 DoubaoBot / Bytespider、DeepSeekBot、KimiBot、QwenBot:全期 0 次
- 全期 robots.txt 被请求 1046 次、sitemap.xml 被请求 349 次、llms.txt 被请求 66 次(说明这份文件确实被机器读取,不是摆设)
- 同期,百度搜索资源平台的月度展现与点击都是 0——索引都没建立,谈 AI 引用还太早
这组数字最重要的一层含义是:在「国内 AI 爬虫全期 0 次」的同时,公众号这条第②类通道其实一直在产出,只是它不写在任何日志里。我们发布在公众号上的文章进入微信生态后,元宝就具备了引用的前提——这部分效果,用服务器日志永远测不出来。
所以「等了一个月没动静」有两种完全不同的解释:一种是第①类通道的收录周期本来就长(新站按月计);另一种是你一直在优化第①类,而客户提问的答案来自第②类。先分清是哪一种,再决定要不要继续等。
这份地图不能说明什么
- 各平台的策略会变,而且变得不慢。爬虫标识、生态权重、接口开放程度都可能在几个月内调整。文中的信息核实到 2026 年 10 月,建议每季度复核一次,尤其是豆包与元宝。
- 部分数据来自第三方而非官方。凡是我们没能在厂商官方页面核实的(字节 bot 家族数量、元宝生态权重百分比、百家号权重倍数等),文中都已标注为第三方来源,只作方向参考,不要引用成结论。
- 信源通道 ≠ 收录结果 ≠ 被引用 ≠ 有流量。这四件事之间隔着好几层,本文只解决第一层。
- 实测基线样本极小:1 个站点、3 周、十余次爬虫事件。它能作为一个观察点,不能外推成行业规律。
- 对内容型站点更适用。工具站、电商站、本地生活类站点的抓取动机与路径不同,不能整段套用。
微信内识别二维码分享此文