30 秒答案:先进入候选集合,才谈得上被引用
利益关系披露:DragonAI 运营 AI 产品经理课程,并监测本域名在 AI 搜索中的可见性。本文用于解释可观测证据链,不掌握千问、Kimi、Gemini 或其他平台的完整内部排序权重,也不保证采用某种页面格式即可获得抓取、收录、引用或业务结果。
AI 搜索为什么引用某个来源,外部通常无法用一个公开公式回答。更可靠的解释是把过程拆成七层:页面可访问、被抓取与进入可用索引、问题触发搜索或检索、候选来源被召回和重排、来源被展示为引用、内容被答案吸收,以及最终用户结果。上一层可以是下一层的必要条件或诊断信号,但不能自动证明下一层已经发生。
| 层级 | 可以直接保存的证据 | 仍不能推出 |
|---|---|---|
| 1. 可访问与发现 | 规范 URL、HTTP 成功、robots 与 sitemap 状态、站内入口 | 搜索引擎已抓取 |
| 2. 抓取与产品索引 | 经过验证的抓取日志;产品明确提供的索引状态 | 当前问题会召回该页 |
| 3. 搜索或检索触发 | 回答或接口显示执行搜索;固定搜索查询出现目标 | 目标页进入生成上下文 |
| 4. 候选与上下文分配 | 平台允许取得的候选、排名、上下文或调试记录 | 页面会被展示为引用 |
| 5. 引用选择 | 展示层引用 URL 规范化后命中目标域名或页面 | 页面内容影响了答案 |
| 6. 内容吸收 | 按预设规则识别答案使用了目标事实、语言、结构或证据 | 用户访问、信任或转化 |
| 7. 用户结果 | 分析或业务系统中的访问与合规结果 | 单次引用独立造成结果 |
这张表是证据分层,不是某个平台公布的算法流程。不同产品可能使用传统搜索、自己的索引、检索增强生成、工具调用或多种来源组合;平台也可能不公开候选集和上下文。缺失的内部字段应记为未知,不能用营销说法补齐。
一、引用选择与内容吸收是两个结果
一项 2026 年的信息检索预印本把 GEO 测量拆为引用选择和引用吸收:前者观察平台是否触发搜索并选择来源,后者观察被引页面是否为最终答案贡献语言、证据、结构或事实支持。该研究基于其公开数据集报告,引用广度与引用深度可能不同;来源数量更多,不等于每个来源对答案影响更大。
因此,监测时至少要保留两列:
targetCited:展示的具体 URL 是否命中预先登记的目标;absorptionStatus:按预先固定的规则判为positive、negative、not_measured或invalid。
如果平台只展示来源列表、但没有可合法保存和比较的回答证据,就只能报告引用选择。把所有引用都写成“模型采用了我们的观点”,会越过现有证据。
二、哪些页面特征可能与引用有关?
引用选择—吸收研究在其受控数据中观察到,高影响页面往往更长、结构更清楚、与问题语义更对齐,并包含可提取的定义、数值事实、比较和步骤。它们是特定数据与平台中的描述性关联,不是“增加字数、表格或数字即可提升引用率”的因果处方。
同年一项批判性综述把 GEO 描述为随机、部分可观测的多阶段管线。综述认为,主题相关性和进入上下文后的位置是相对可重复的信号,而通用改写技巧迁移有限,面向引用的改写甚至可能损害检索。它还指出,已有证据主要能说明内容在已经进入上下文后可能改变引用或使用,不能证明某种技巧对自然发现或下游行为具有稳定、长期、跨平台因果效果。
把研究边界转成发布动作时,可以优先做这些可核验事项:
- 用一个页面回答一个清晰问题,在标题、直接答案和正文中保持同一意图;
- 提供可以单独摘录的定义、判断条件、比较表、步骤和限制;
- 为事实声明链接到能支持该声明的来源,不用引用数量替代来源质量判断;
- 保持规范 URL、稳定正文、作者、更新时间和发布者关系可识别;
- 从真实相关的索引页和内容页建立内部链接,避免孤立页面;
- 有原始观察时公开字段、计数规则和机器可读数据,同时保留零结果;
- 把每一项视为待测假设,通过固定查询和重复运行验证,而不是事先宣称有效。
三、为什么不同平台会引用不同来源?
可观察差异可能来自搜索索引、搜索是否触发、候选召回、重排、上下文长度、引用展示机制、模型与产品版本、地区、账号和随机波动。外部结果通常不能单独识别是哪一个机制造成差异。
DragonAI 的探索样本 A 在一个固定中文 RAG 与微调问题上对千问、Kimi、Gemini 各运行三次,没有观察到一个精确主机名同时出现在三家结果。这个 9 次运行的局部样本只证明该问题和时间窗口中的来源集合不同,不代表后续正式 B/C 窗口、非因果补充观察、平台长期偏好或总体来源权重。另有研究指出,AI 搜索答案会随运行、问题表达和时间变化,因此一次结果不适合作为稳定可见性估计。
对于“AI 搜索 RAG 微调 引用来源 对比(千问、Kimi、Gemini 当前实测基准)”这一登记研究,可以核对五批共 45 次固定查询运行、2026-08-14 当前 9 次复测,以及百度 3 条严格无品牌查询。当前修订 10 跨发布账本覆盖 31 个生产发布、46 次严格观察、138 个查询快照和 1,137 个自然结果位置,DragonAI 目标页和品牌域命中仍为 0;26 次逐查询证据卡继续作为历史切片保留,不再代表当前累计分母。截至 2026-08-14 15:04 UTC,当前 9 次复测中千问、Kimi、Gemini 分别展示 20、0、71 个具体 URL,共 91 次 URL 出现和 50 个不同 URL;当前 9 次逐运行 JSON与逐引用 CSV直接保留逐平台、逐运行记录。百度 3 条严格查询有 25 个自然位次、22 个不同结果 URL。当前百度—模型引用交集 r2 JSON与逐 URL 全外联表共保留 70 行,其中 https://post.smzdm.com/p/aqr0p0x2/ 与 https://segmentfault.com/a/1190000047799820 两个精确 URL、blog.csdn.net、post.smzdm.com 与 segmentfault.com 3 个规范化主机同时出现。三条严格查询答案地图 JSON把模型引用、百度自然结果和 Bing 搜索观察分栏保存,避免把不同表面合成一个“引用排名”。DragonAI 在百度和模型引用两侧均未出现;竞争结果进入或退出也不等于来源质量、目标排名变化或 GEO 成功。原始 URL、失败分母、排名变化以及零结果均被保留;页面没有把抓取、IndexNow、时间经过、竞争来源重复或第一方数据资产当作引用成功。
跨引擎结果还会分化:匿名 Bing 中国区从 2026-08-14 22:08 到次日 09:02 UTC 的十二次保存观察中,都只在第二条固定无品牌查询“AI 搜索 RAG 微调 引用来源 对比”把 DragonAI 唯一目标页列在第 1,另外两条始终为 0。十二次观察持久性 JSON与 CSV 保留 36 个查询快照、360 个自然结果出现、38 条查询—精确 URL 行和 27 条查询—精确主机行。百度阴性与 Bing 单引擎阳性并存,说明不能从一个引擎外推另一个引擎,也不能从自然排名外推生成式引用选择;十二个点时结果仍不证明长期排名、排名因果、品牌提及、AI 引用或跨引擎 GEO 成功。
2026-08-13 对固定选型查询的百度生成式答案进一步说明了为什么必须分层记录:答案点名 6 类来源,其中百度智能云、腾讯云、CSDN 和知乎 4 类也出现在自然结果,但展开后的参考文档只暴露 1 条百度百科具体链接;DragonAI 在答案点名、自然结果和具体引用三层均为 0。可下载来源层差距 JSON或7 行 CSV逐类复核。点名不是具体引用,自然结果不是生成式引用,具体引用也不是自然排名;三层差异只定位可见性缺口,不证明来源质量、平台长期偏好或排名因果。
同一研究还把第二次百度严格无品牌观察的 25 个不同自然结果 URL,与窗口 C 的 74 个不同 AI 引用 URL 做了逐 URL 全外联结:98 个联合 URL 中只有 https://hub.baai.ac.cn/view/35723 同时出现,DragonAI 目标 URL 在两侧均未出现。这个点时交集说明“同一主机出现”不能替代“同一页面出现”的核对,也不能据此反推共享索引、引用选择机制、排名原因或来源质量。
四、RAG、微调与“引用来源”是什么关系?
RAG 在回答时检索外部内容,可以形成可打开的来源链;微调主要改变模型在固定任务上的行为或输出,不天然提供当前事实的出处。但不能因为一个 AI 产品会联网搜索,就断言它公开展示了完整 RAG 管线,也不能从引用列表反推出训练数据或内部权重。
当问题是“RAG 和微调怎么选”时,一篇页面可能因为它回答了技术意图而成为候选来源;当问题是“千问、Kimi、Gemini通常引用哪些来源”时,逐运行研究与数据集更贴近元问题意图。两个页面应互相链接,但不应复制标题和主答案。技术决策可查看 RAG 和模型微调四方案决策矩阵。
五、用最小实验定位问题在哪一层
如果页面一直没有被引用,不要一次改动标题、结构、链接和正文后再把任何变化归因于其中一项。先固定无品牌查询、目标 URL、平台、模型、联网设置、地区、重复次数、解析器和归因规则,再逐层记录:
| 检查 | 阳性条件 | 阴性时下一步 |
|---|---|---|
| 发布 | 规范 URL 返回预期版本 | 修复网络、重定向、canonical 或渲染 |
| 抓取 | 合格抓取器在发布后成功获取目标 | 检查发现入口、许可与服务器日志 |
| 搜索可见 | 固定无品牌搜索出现目标 URL | 检查索引状态、主题对齐与站内链接 |
| 品牌提及 | 回答正文命中登记实体别名 | 与 URL 引用分开记录 |
| 目标引用 | 展示层具体 URL 命中登记目标 | 保留零结果并检查候选竞争来源 |
| 内容吸收 | 满足预设内容贡献规则 | 无法判定时记录 not_measured |
下载 AI 搜索引用监测协议 JSON,可以固定查询登记、逐运行字段、失败分母、引用与吸收状态。更完整的分母和 URL 归一化规则见 AI 搜索引用率监测方法。
六、五个常见但不能成立的跳步
- 有 sitemap,所以会被引用:sitemap 只是发现入口。
- Googlebot 或 Bingbot 抓过,所以 AI 已收录:抓取日志不等于具体产品索引。
- 页面在品牌词或 site 查询出现,所以无品牌可见:查询意图不同。
- 列出作者、FAQ 和 Dataset,所以平台会选中:页面声明了这些结构,不等于平台已解析或会引用。
- 一次回答引用了页面,所以排名已经提升:一次观察不能代表稳定分布。
这些上游状态都值得记录,但只有固定无品牌问题中的真实目标引用、品牌提及或按规则判定的吸收,才能进入对应结果层。要比较“地位是否上升”,还需要同口径时间窗口、重复运行、竞争域和位置证据。
使用边界
本文是基于公开研究和 DragonAI 第一方点时样本整理的测量与发布框架,不是千问、Kimi、Gemini 或搜索引擎的官方算法说明。引用选择研究和 GEO 综述均为预印本;其样本、平台和方法限制必须保留。平台名称属于各自权利人的产品标识,本文不暗示合作或背书。
