30 秒答案:先打通抓取链路,再单独验证收录与引用
利益关系披露:DragonAI 运营本网站、AI 产品经理课程与自身 GEO 流程。本文包含本站第一方技术审计,不是 OpenAI、Google 或其他平台的认证,也不保证抓取、索引、排名、提及、引用或业务结果。
让网站进入 AI 搜索链路,至少要通过三道不同门:允许发现与抓取、满足索引或检索条件、在具体问题的回答中被选择和展示。 robots、Sitemap、提交接口或一次爬虫访问只覆盖前一部分,不能证明后两部分。
OpenAI 当前发布者说明称,公开网站可以出现在 ChatGPT Search;若希望内容进入摘要和片段,应确保没有阻止 OAI-SearchBot。OpenAI 还提供 SearchBot IP 范围地址,供需要网络允许列表的发布者使用。Google 对自身搜索系统则明确区分抓取、索引编制和呈现,并说明即使满足技术要求也不保证每个阶段都会发生。
下载 AI 搜索发布者 10 项就绪清单 JSON,其中同时保留 DragonAI 在 2026-07-21 的公开技术审计零值。
一、先分清“抓取、收录、搜索可见、引用”
| 层级 | 合格证据 | 仍不能推出 |
|---|---|---|
| 1. 抓取许可 | robots 规则允许目标爬虫访问目标路径 | WAF、CDN 或服务器真的放行 |
| 2. 合成访问 | 使用登记 UA 的测试请求返回 200 和完整正文 | 请求来自平台官方爬虫 |
| 3. 已验证抓取 | 日志中的来源身份按平台公开方法验证并成功取页 | 页面已进入索引或检索库 |
| 4. 搜索可见 | 固定无品牌搜索结果出现目标 URL | AI 回答会引用它 |
| 5. 品牌提及 | 固定无品牌 AI 回答正文出现登记实体 | 目标网页被引用 |
| 6. 目标引用 | 展示层来源命中登记域名或 URL | 页面独特内容被答案吸收 |
如果工具把这些层级合并成“已被 AI 收录”,就无法判断问题发生在许可、网络、索引、检索还是引用选择。
二、发布者 10 项检查
A1. 公开 URL 直接返回成功
目标页面应在无登录、无 Cookie、无验证码的公开请求下直接返回 2xx 或约定的规范重定向。检查最终 URL、状态码、重定向链、内容类型和响应时间;不要只在员工浏览器的登录会话里测试。
A2. robots 按爬虫用途设置
如果 User-agent: * 已允许公开路径且没有更具体的阻止规则,通常不需要为了形式重复添加 OAI-SearchBot Allow: /。但团队可以显式分组,使政策更容易审计。robots 的组匹配与路径规则应按正式协议实现,不能依靠人工目测猜测。
下面只是“允许 ChatGPT 搜索抓取,同时排除潜在训练”的政策示例,不是所有网站都必须采用的默认值:
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
OpenAI 当前发布者说明把这两个决定分开:不要阻止 OAI-SearchBot,才能帮助内容进入 ChatGPT 摘要与片段;希望排除潜在训练时,另行阻止 GPTBot。网站负责人应由法务、内容和技术共同确认政策,而不是让部署脚本擅自决定。
A3. 检查 WAF、CDN、Bot Management 与限流
robots 允许不代表网络层放行。检查 403、429、验证码、JavaScript Challenge、地区限制、请求速率和安全事件。若必须按 IP 允许,应实时引用平台官方 IP 列表,不要把某次下载的地址永久复制到文章或配置中。
合成 UA 测试只能发现明显的按 UA 阻断;它不能证明请求来自平台,也不能替代真实日志中的来源验证。
A4. 确认 noindex 与 X-Robots-Tag
HTML 的 robots meta 和响应头 X-Robots-Tag 都可能阻止索引。OpenAI 的发布者 FAQ 还说明,爬虫必须先能访问页面,才可能读取页面中的 noindex;因此“robots 禁止抓取 + 页面写 noindex”不能被当作所有产品都会读取的双保险。
A5. 固定规范 URL
每个内容资产应有唯一 HTTPS 规范地址。canonical 不应指向首页、旧域、参数变体或另一篇相似文章;重定向、Sitemap、Feed、结构化数据和内部链接也应指向同一地址。
A6. 让核心答案存在于服务器 HTML
在不执行客户端脚本时,HTML 中应仍有标题、直接答案、正文、来源、更新时间和关键链接。图片、视频或交互工具可以补充信息,但不应是唯一载体。
A7. 建立真实发现入口
从首页、主题页和相关正文提供描述性内部链接,并将规范 URL 放入 Sitemap。Feed、数据集索引和 llms.txt 可以增加机器可读入口,但是否被具体平台采用要另行验证。
Google 公开说明指出,链接和 Sitemap 都可帮助其发现新页面,同时也提醒 site: 结果并不保证列出指定前缀下的全部已索引 URL。因此 site: 只适合作为诊断信号,不应成为唯一收录判定。
本站的千问、Kimi、Gemini RAG 与微调引用来源实测基准提供了一个阴性测量例子:研究公开 9 次探索运行、9 次正式发布前基准与五批共 45 次固定查询运行;五批记录包含 552 次具体引用 URL 出现,但 DragonAI 目标引用和品牌提及仍均为 0。当前修订 10 可比百度账本覆盖 31 个生产发布、46 次严格无品牌观察、138 个查询快照和 1,137 个自然结果位次,目标页与品牌域仍为 0;26 次观察逐查询证据卡 JSON继续作为历史切片保留,不再代表当前累计分母。2026-08-13 21:22 UTC 对选型查询的只读复核另保留 8 个自然结果,前三主机为腾讯云、百度智能云和百家号;当前变化 r2 JSON记录 4 条 URL 保留、4 条进入、4 条退出及 2 条留存 URL 换位。页面生成式摘要未提及 DragonAI,本轮也未捕获可核对引用链接。历史账本继续作为不可变分母保留。它说明发现入口、机器可读文件、引用总量或时间经过都不能替代实际目标引用证据,也不说明这些上游工作没有必要。
A8. 提供可核验、可独立摘录的信息
首屏直接回答一个问题;重要声明邻近原始或第一方来源;表格、数字和数据集说明口径、时间与限制。不要为每个问法生成一页,也不要把结构化数据、关键词密度或文章长度当作引用开关。
A9. 保存真实爬虫证据与失败
日志至少保留时间、来源 IP、UA、方法、路径、状态和响应字节。只有通过平台公开 IP 范围、DNS 或验证程序确认的请求才标记为“已验证爬虫”;无法验证的 UA 单独记录。404、403、429 和 5xx 不应从报告中删除。
A10. 用固定无品牌问题验证结果
将品牌实体、目标域名和目标 URL 预登记,再固定问题、平台产品入口、联网状态、地区、账号条件、重复次数和归因规则。分别报告计划、成功、失败、不可判定、品牌提及、目标引用和竞争域。
完整计算字段见 AI 搜索引用率监测协议。
三、DragonAI 当前公开技术审计
2026-07-21 22:49 UTC,本站对首页与 GEO 定义页做了站方检查:
- 生产
robots.txt返回成功,通配组允许公开路径,只阻止内部/__manus__/路径; - OAI-SearchBot、GPTBot 与普通搜索爬虫在当前规则下都被通配组允许,本站尚未选择单独的潜在训练退出策略;
- 目标页面返回 200,HTML 中有直接答案、
index, follow、准确 canonical 与可见正文; - 目标 URL 出现在 Sitemap、Feed、首页或主题集群中;
- 最近 48 小时受检日志没有观察到 OAI-SearchBot、ChatGPT-User 或 GPTBot UA;
- 因为尚无真实 OAI-SearchBot 命中,本审计只能判定为“技术许可就绪,官方抓取未验证”。
这些字段与证据限制已写入下载 JSON。UA 不出现也不能证明 OpenAI 永远没有访问:日志窗口、代理、产品路径和平台行为都可能不同。
四、常见误判
robots.txt允许 → 只能说明站方许可,不说明网络放行或真实抓取;- 合成 OAI UA 返回 200 → 不说明官方爬虫访问;
- Sitemap、IndexNow 或 Feed 提交成功 → 不说明索引或引用;
site:出现 → 不说明无品牌搜索可见,更不说明 AI 引用;- 品牌词能搜到 → 不说明用户不知道品牌时也能发现;
- AI 回答提到品牌 → 不说明目标页面是来源;
- 一次来源卡片命中 → 不说明稳定排名、内容吸收或业务结果;
- 到达等待时长 → 只是复测时点,不是阳性证据。
五、什么时候应该修技术,什么时候应该改内容
若真实官方爬虫收到 403、429、验证码或登录页,应先修 WAF、CDN、身份验证和限流;若没有发现入口,先补内部链接与 Sitemap;若抓取成功但没有搜索可见,检查索引、canonical、重复内容与问题相关性;若搜索可见但 AI 不引用,再比较实际引用来源的独特信息、声明证据和结构,而不是继续重复提交。
使用边界
OpenAI 的 OAI-SearchBot 与 GPTBot 说明只适用于 OpenAI 当前公开产品;Google 的三阶段说明只描述 Google 搜索。不能由这些资料推断千问、Kimi、Gemini 或其他平台采用相同抓取器、索引或引用机制。公开 IP 地址和产品规则可能更新,应在实施时读取官方当前版本。本文不是平台内部索引说明、法律建议或效果承诺。
