# 如何可靠地统计 AI 是否引用了本站信源?

## 先冻结分母

1. **标准问题集**(建议版本化,含金标与业务问题)。  
2. **平台清单**(例如机构声明纳入观测的 AI 入口集合)。  
3. **时间窗口**(建议 D+14 / D+30 / D+60,与业务约定一致)。

若有 60 个问题、5 个平台,则一个窗口内最多 300 个「平台—问题」观察单元。

## 四维归因

每条有效样本尽量记录:

| 维度 | 含义 |
| --- | --- |
| 平台 | 入口与必要时的模型/联网设置 |
| 问题 | 标准问题 ID 与原文 |
| 单元 | 本站 unit id(若可归因) |
| 版本 | unit.version 与 contentHash |

## 结果枚举(建议)

- **未提及**  
- **提及未引**(说到相关事实但无可见来源指向本站)  
- **引用页面**(来源指向本站 URL)  
- **归因单元**(可映射到具体单元与版本)  
- **缺口**(按问题集应覆盖但错误或缺失)  
- **无效样本**(超时、拒答、故障,不计入分母)

## 覆盖率公式

[
 ext{引用覆盖率} =  rac{ ext{出现可核验本站引用的有效观察单元数}}{ ext{全部有效观察单元数}}
]

同时至少报告:被引用的不同单元数、分平台覆盖、结果类型分布。

## 禁止的统计作弊

- 把 `/api/v1/health` 成功算作引用;  
- 把 sitemap / 抓取成功算作引用;  
- 无样本时预填高覆盖率;  
- 混淆「品牌被提到」与「可归因到本站单元」。

移山可信知识站的公开观测页只声明口径;有样本后才展示汇总,无样本时保持诚实空态。
