易云GEO证据等级说明:官方事实、实测观察与行业推论
GEO这个行业目前有一个普遍问题:大量关于「某个AI平台偏好什么内容」的说法在流传,但拿不出厂商官方文档作为出处。这些说法被反复转述后,逐渐被当成了行业常识。
我们的做法是把所有对外表述按证据强度分成三级,并在网站各处标明出处。这样做会让文案显得不那么绝对,但客户可以自己核对每一条依据。对一家替客户做GEO的公司来说,官网自身的严谨程度就是产品能力的样本。
一、三级证据标准
| 等级 | 定义 | 核验方式 | 能否作为结论 |
|---|---|---|---|
| A级 官方事实 | 厂商官方文档、公告或产品文档中能查到原文的内容 | 可直接打开厂商文档核对原文 | 可以,但须注明出处 |
| B级 易云实测 | 来自易云自有站点服务器日志与人工问答测试的观察记录 | 可按时间、User-Agent、IP、请求路径逐条复核 | 只能作为存在性证据,须同时说明样本量与观察周期 |
| C级 行业推论 | 没有官方出处的经验判断、第三方解读或社区流传说法 | 无法核验 | 不可以,仅作为待验证假设记录 |
三级之间不是可信度高低的连续刻度,而是性质不同。A级说明「厂商公开了什么机制」,B级说明「我们观察到了什么现象」,C级说明「行业在猜测什么」。把B级当A级用,或把C级包装成A级,是这个行业最常见的两种误导。
二、已核验的A级官方依据清单
以下每一条我们都取到了厂商文档原文,核验日期为2026年7月30日。厂商文档可能随时更新,如发现与本页描述不一致,以厂商最新原文为准。
2.1 火山引擎(豆包)站点权威度分级
火山引擎发布的《站点权威度分级说明》(首次发布2026年6月2日,更新2026年6月22日)把站点权威度分为四级:
- 非常权威:内容来源真实可信,经过审核及筛选
- 正常权威:行业优质站点、综合性门户,有较高专业性及可信度
- 一般权威:普通网站,内容来源无法考证,部分内容有参考价值
- 一般不权威:普通小站,劣质虚假信息较多
最高一级是一份封闭清单,按站点类型划定,包含:gov.cn各级政府网站;二甲及以上公立医院与公立博物馆;央媒;地区官方媒体(官方举例含大众网、齐鲁网);985与211高校官网;世界及中国500强企业官网;字节自有高质量数据源(火山如意、抖音百科即快懂百科);以及五大新闻门户中经「新闻媒体」或「国家机构」认证账号的发文。
这条依据的实际含义需要说清楚:普通企业官网无论怎么优化都进不了最高一级,客观位置在中间两级。但这不意味着优化无意义——见下一条。
2.2 豆包搜索API的权威度参数
豆包搜索API文档显示,AuthInfoLevel 既是请求过滤参数,也是每条返回结果的必带标注。其默认值为0,表示不限制权威等级,只有显式设为1才仅返回最高一级结果。官方示例中出现过 "AuthInfoDes": "正常权威",说明第二级结果会被正常返回。文档另有 Industry=gov 参数,是更严格的政务信源子集。
结论:企业官网默认参与检索,不会因为不在最高一级清单里被排除。
2.3 OpenAI 四个爬虫标识
OpenAI官方爬虫文档列出四个相互独立的标识,需在robots.txt中分别声明:GPTBot(训练语料)、OAI-SearchBot(搜索索引)、ChatGPT-User(用户主动触发)、OAI-AdsBot(广告落地页校验)。官方明确说明:被 OAI-SearchBot 屏蔽的站点不会出现在ChatGPT搜索答案中,并建议站点放行该标识。屏蔽 GPTBot 不影响 OAI-SearchBot。
2.4 Anthropic 三个爬虫标识
Anthropic官方文档(2026年4月7日更新)列出三个标识:ClaudeBot(训练)、Claude-User(用户触发)、Claude-SearchBot(搜索索引)。官方说明禁用 Claude-SearchBot 会降低站点在搜索结果中的可见性,并推荐用robots.txt而非封禁IP来管理,因为封IP会妨碍爬虫读取robots.txt。
2.5 Kimi 三个爬虫标识
Kimi官方爬虫文档列出:KimiBot(训练)、Kimi-User(用户触发)、Kimi-SearchBot(搜索索引)。官方明确写明禁止 Kimi-SearchBot 会导致网站无法出现在Kimi搜索结果中。文档另提到对动态加载网页可能只能获取初始HTML,因此保持正文可直接读取是有依据的工程要求。
2.6 阿里云对AI爬虫的三分类
阿里云WAF文档把AI爬虫分为三类:AI-Crawler(训练与RAG语料采集,典型代表包含Bytespider)、AI-Search(实时问答引用,会带来曝光,典型代表OAI-SearchBot、PerplexityBot)、AI-Agent(代替用户操作)。
这条依据推翻了一个常见推论:既然官方把Bytespider归为训练语料类而非实时引用类,那么「Bytespider抓取量上升等于豆包引用量上升」这个推理就不成立,两者需要分别观察。
2.7 其他已核验依据
- 百度智能云千帆:联网搜索文档公开
web_search、enable_citation、enable_trace等能力,说明模型回答可建立在联网检索的网页来源上并提供溯源。但百度未公开搜索排名与文心引用顺序的对应关系。 - 阿里云通义联网检索:官方文档写明可实时检索多源信息、自动筛选权威来源、支持追溯引用,并提供指定网站检索与时效范围控制。未公开内容形式偏好。
- 腾讯元宝WSA:(更新2026年6月30日)信源包含腾讯新闻、搜狗百科、企鹅号,标准版以上支持优质权威垂直信源。注意企鹅号与微信公众号是不同产品。
- DeepSeek:官方公告与用户协议(2025年9月5日版)说明开启联网搜索后先检索互联网公开信息再基于检索结果生成回答。未发布站长指南、爬虫标识或引用排序规则。
- 百度搜索资源平台:《关于回收网站资源提交配额的通知》(2023年9月22日)说明会对非实名账户内站点与低质站点关停sitemap提交能力并调整API每日推送额度。
三、B级:易云自有站点实测数据
以下数据来自 www.aisourcegeo.com 的Nginx访问日志,观察周期为2026年4月13日至7月30日,共109天、约14万条请求记录。这是原始一手数据,可按User-Agent、IP、时间与请求路径逐条复核。
3.1 各爬虫实际抓取量
| 爬虫标识 | 109天请求数 | 说明 |
|---|---|---|
| 360Spider | 1767 | 抓取量最高 |
| ClaudeBot | 1751 | 训练类,非搜索索引 |
| bingbot | 1550 | |
| Googlebot | 1444 | |
| Baiduspider | 1215 | 日均约11次,偏低 |
| OAI-SearchBot | 948 | 决定ChatGPT搜索可见性 |
| ChatGPT-User | 841 | 用户主动触发 |
| Bytespider | 776 | 字节唯一公开标识 |
| GPTBot | 714 | 训练类 |
| Amazonbot | 501 | |
| Sogou web spider | 378 | |
| PetalBot | 352 | 华为 |
| Applebot | 347 | |
| CCBot | 173 | Common Crawl,多家模型语料上游 |
| PerplexityBot | 110 | |
| meta-externalagent | 98 | |
| YisouSpider | 72 | 神马 |
| DeepSeekBot | 54 | 标识未获官方确认 |
| KimiBot / Kimi-SearchBot / Kimi-User | 0 | 三个官方标识均无访问记录 |
| Claude-SearchBot | 0 | 官方存在但未访问本站 |
值得注意的两点:Kimi的三个官方爬虫在109天内一次都没有访问,说明放行robots.txt并不等于会被抓取;而Claude与OpenAI都是训练类爬虫抓取量远高于或等于搜索类,两类需要分开看待。
3.2 Bytespider 的 User-Agent 构成
把 Bytespider 的 776 次请求按 User-Agent 拆开,可以看到一个相当明确的现象:
| User-Agent 类型 | 109天请求数 | 占比 |
|---|---|---|
| 移动端(含 Android / Mobile Safari 标识) | 764 | 98.5% |
| 桌面端(含 Windows / Macintosh / X11 标识) | 0 | 0% |
| 无设备标识 | 12 | 1.5% |
其中出现次数最多的两个完整标识是:
Mozilla/5.0 (Linux; Android 5.0) AppleWebKit/537.36 (KHTML, like Gecko) Mobile Safari/537.36 (compatible; Bytespider; https://zhanzhang.toutiao.com/),620 次Mozilla/5.0 (Linux; Android 5.0) AppleWebKit/537.36 (KHTML, like Gecko) Mobile Safari/537.36 (compatible; Bytespider; spider-feedback@bytedance.com),139 次
这组数据能说明什么,不能说明什么:它能证明在本站的观察窗口内,Bytespider 实际使用移动端 User-Agent 抓取,桌面端一次也没有出现,因此「保证移动端页面能正常渲染」这个动作有一手数据支撑,不是凭空建议。它不能说明字节官方规定了移动优先的抓取策略——字节并未公开抓取策略文档;也不能推广为所有站点都是这个比例,这是单站点、109 天的观察结果。
3.3 豆包App用户访问记录
日志中有一类请求的User-Agent带有 AppName/doubao 与 BytedanceWebview 标识,来自豆包App的内置浏览器,属于真实用户点击而非爬虫抓取。剔除本公司自身测试访问后:
- 109天内有20个独立IP经豆包App访问本站,共117次请求
- 按月分布:5月1次、6月33次、7月36次
- 访问页面覆盖首页(31次)、案例中心(6次)、行业白皮书PDF(6次,含完整下载)、区县专题页、平台问答页与联系页
这组数据能说明什么,不能说明什么:它能证明豆包在实际回答中引用过本站内容,且用户点击后有深度浏览与下载行为。它不能说明引用规律、触发条件或增长趋势——20个IP、117次请求是很小的样本,两个月的环比也不足以判断趋势。我们把它作为存在性证据披露,而不是效果承诺。
四、C级:常见但查不到官方出处的说法
以下说法在行业内流传较广,我们没有找到任何厂商官方文档能够支撑,因此不在网站任何位置作为结论使用:
| 流传说法 | 为什么不采信 |
|---|---|
| 豆包App对抖音内容有固定加权 | 官方只公开了API侧的信源分级清单,从未公开App侧排序规则。信源等级清单与排序算法是两件事 |
| 豆包站点分S/A/B级、官网权重占百分之多少 | 官方分级是四个中文档位,不存在字母分级或权重百分比的说法 |
| DeepSeek偏好长文或某种特定结构 | DeepSeek未发布任何站长指南或引用规则文档 |
| 通义千问偏好表格化内容 | 阿里云文档只说明检索能力,未提及内容形式偏好 |
| 元宝微信公众号权重高 | 官方文档列出的是腾讯新闻、搜狗百科、企鹅号,企鹅号不等于微信公众号 |
| MoonshotBot 是Kimi的爬虫标识 | Kimi官方文档中不存在该标识,实际为KimiBot等三个 |
| DoubaoBot、YuanbaoBot、QwenBot、ERNIEBot | 均无官方出处。字节唯一公开标识是Bytespider,其余三家未公开独立标识 |
| 结构化数据能提升AI引用率 | 结构化数据的作用是明确页面实体与层级关系,这一点有Schema.org标准支撑;但「提升引用率」缺少可核验的因果证据,我们把它列为待验证项 |
| llms.txt 是AI收录信号 | 没有任何中国AI平台的官方文档将其列为收录或引用信号。本站保留该文件但不投入维护 |
五、待验证清单
以下问题我们正在持续观察,在拿到可复核的数据之前,不会写成结论:
- Bytespider抓取量变化与豆包实际引用量之间是否存在关联
- 结构化数据对国内大模型引用的实际影响
- 百度自然排名与文心引用顺序的关系
- 同一稿件在多家媒体分发的边际效果
- 站点权威等级与被引用概率之间的量化关系
六、说明与更新机制
本页所引厂商文档均可公开访问,核验日期为2026年7月30日。厂商文档更新频繁,如出现不一致,以厂商最新原文为准,同时欢迎指出本页错误。
易云GEO不承诺固定的AI引用位次或排名结果。原因很直接:各平台的排序算法均未公开,任何承诺特定位次的说法都缺少实现依据。我们能承诺的是技术实施到位、依据可核验、实测数据如实披露。
本页数据涉及的服务器日志为易云自有站点数据,不包含任何客户站点信息。
内容声明:本文由山东易云网络有限公司(易云GEO)研究团队原创发布,所引官方文档出处均经人工核验。
最后更新: | 作者:易云GEO研究团队