30 秒答案:不要用一个“GEO 分数”吞掉四种不同问题
利益关系披露:DragonAI 运营 AI 产品经理课程,并监测本域名在 AI 搜索中的可见性。本文公开指标定义和零目标引用样本,不把高重复、高重叠、抓取、IndexNow 或时间经过写成品牌 GEO 成功,也不对千问、Kimi、Gemini 作质量排名。
“AI 搜索引用来源稳定吗”至少包含四个问题:一次完成运行是否展示具体引用、同一平台是否重复相同页面、不同平台是否使用相似来源集合,以及引用是否集中于少数主机名。四个问题的分子和分母不同,不能压成一个来源数量或综合分数。
| 指标 | 公式 | 回答的问题 | 不能推出 |
|---|---|---|---|
| 引用展示运行覆盖率 | 有至少一个具体引用 URL 的完成运行数 ÷ 完成运行数 | 完成运行中有多少次显示可归因来源 | 来源正确或内容被吸收 |
| 重复 URL 占比 | 至少在 k 次运行出现的不同 URL 数 ÷ 全部不同 URL 数 | 同平台短窗口内具体页面是否复现 | 长期稳定或来源可靠 |
| 主机名 Jaccard 重叠 | 两组主机名交集大小 ÷ 并集大小 | 两平台来源域集合有多相似 | 共用索引、算法或具体页面 |
| 最高主机名集中度 | 最多主机名引用出现次数 ÷ 全部规范化 URL 出现次数 | 引用是否集中于一个主机名 | 主机名质量或平台好坏 |
下载 AI 搜索引用来源稳定性指标 JSON,可以直接取得公式、字段、分子分母和本文示例值。
一、引用展示运行覆盖率:先回答“有没有具体来源”
设完成运行数为 N,其中至少展示一个可解析、可规范化具体 URL 的运行数为 C:
citation_surface_run_coverage = C / N
这个分母必须预先确定。完成但无引用、拒答、超时、搜索未触发和无法解析不能事后静默删除;它们应按登记的分母政策分别保存。覆盖率只说明引用展示面是否可观察,不能说明引用页面正确、答案采用了页面内容或品牌获得推荐。
DragonAI 的 9 次探索样本里,三个平台各 3 次完成运行都显示了至少一个具体 URL,因此三家的示例覆盖率都是 3/3 = 100%。这不等于三家引用质量相同,只说明该短窗口的展示层都可归因。
二、重复 URL 占比:同一具体页面是否跨运行复现
对同一平台、问题和窗口建立每次运行的规范化 URL 集合。设全部不同 URL 的并集大小为 U,至少在 k 次运行中出现的不同 URL 数为 Rₖ:
repeated_url_share(k) = Rₖ / U
在每个平台三次运行的示例中,取 k=2:
| 平台与模型 | 不同 URL U |
至少出现 2/3 次 R₂ |
重复 URL 占比 | 出现 3/3 次 | 全运行重复占比 |
|---|---|---|---|---|---|
| 千问 qwen-plus | 10 | 10 | 100% | 10 | 100% |
| Kimi moonshot-v1-128k | 7 | 2 | 28.6% | 1 | 14.3% |
| Gemini 2.5 Flash | 29 | 6 | 20.7% | 1 | 3.4% |
这些值来自同一个中文问题、两分钟左右的点时窗口和每平台三次运行。千问样本的 URL 集合完全复现,只能描述这一个样本;不能推断千问在其他问题、地区、账号、模型或时间里也会保持相同来源。
三、Jaccard 重叠:两组来源有多相似
对平台 A 与 B 的集合,Jaccard 系数为:
J(A,B) = |A ∩ B| / |A ∪ B|
系数范围是 0 到 1:0 表示没有共同元素,1 表示两个集合完全相同。计算前必须声明集合元素是“规范化完整 URL”还是“精确主机名”。主机名重叠只能说明两个平台都展示过该域名,不能说明引用了同一篇页面。
探索样本按精确主机名计算:
| 平台对 | A 主机名 | B 主机名 | 共同主机名 | 并集 | Jaccard |
|---|---|---|---|---|---|
| 千问 × Kimi | 6 | 5 | zhuanlan.zhihu.com | 10 | 0.100 |
| 千问 × Gemini | 6 | 22 | 无 | 28 | 0.000 |
| Kimi × Gemini | 5 | 22 | arxiv.org | 26 | 0.038 |
三家没有共同的精确主机名。样本很小,而且平台展示能力不同;这些系数不能写成“平台算法相似度”或“来源偏好排名”。
四、来源集中度:引用出现是否集中于少数主机名
设全部规范化 URL 出现次数为 T,出现次数最多的精确主机名为 h*,它的引用出现次数为 M:
top_hostname_concentration = M / T
示例中,千问的最高主机名是 cloud.baidu.com,为 15/30 = 50%;Kimi 的 arxiv.org 为 4/10 = 40%;Gemini 的 www.databricks.com 与 medium.com 并列最高,各为 4/36 = 11.1%。集中度较高只表示本样本更多出现来自同一主机名的 URL;同一主机名下可能有不同页面,也不能用主机名出现次数代替页面级事实审核。
如果要更细致描述分布,可以登记前 k 个主机名份额或信息熵,但样本只有三次运行时,先公开逐运行 URL、精确计数和最高集中度,比输出看似精确的综合分更诚实。
五、跨时间比较前必须锁定的字段
指标公式相同,不代表两个窗口可比较。复测前至少对齐:
- 查询文本、语言、无品牌分类和提示版本;
- 平台、模型、联网模式和产品表面;
- 地区、账号、会话和个性化状态;
- 计划运行次数、时间窗口、间隔和失败分母政策;
- 引用提取器、URL 归一化、目标域名和品牌别名版本;
- 统计单位究竟是原始字符串、规范化 URL、主机名还是运行。
其中任一项变化都可能改变结果。无法对齐时,应建立新基线或只做部分可比分析,不能把两组比例连成因果趋势。公开研究也观察到 AI 搜索结果会随重复运行、问题表达和时间变化,因此一次截图或一次回答不是稳定估计。
六、四类常见误算
- 把 URL 出现次数当作不同 URL 数:同一 URL 跨三次出现是三次出现,但仍是一个不同 URL。
- 把主机名重叠当作页面重叠:
arxiv.org相同不代表论文 URL 相同。 - 删除无引用或失败运行:事后缩小分母会抬高覆盖率和命中率。
- 把高重复写成高质量:复现性、事实正确性、内容吸收和用户结果是不同测量对象。
完整的逐运行字段、失败分母和引用吸收状态见 AI 搜索引用率监测方法。为什么展示引用仍不等于答案使用了内容,可查看 AI 搜索引用来源七层证据链。所有示例 URL 与计数可在千问、Kimi、Gemini 的 RAG 与微调引用来源基准复核。
使用边界
本文的公式是描述性监测定义,不是行业标准、平台官方指标或效果承诺。示例来自便利样本,不能估计平台总体引用概率。平台名称属于各自权利人的产品标识;本文不暗示合作、背书或访问其内部索引与排序权重。
