结论先行
2026 年,GEO 测量正在从“品牌有没有出现、网站被引用了几次”,转向一条更完整的证据链:页面是否有资格被发现,是否进入检索结果,是否被列为来源,页面中的哪些事实真正进入答案,答案是否准确表达品牌,以及这些影响最终有没有转化为用户行为。
这不是给现有指标增加一个更复杂的总分。相反,它要求企业停止把不同阶段压缩成一个“AI 排名”。一个页面可以被引用但没有支持答案中的关键结论,也可以提供了事实却没有得到清晰归因;即使答案采用并准确表达了品牌信息,用户也可能不点击网站。
因此,引用次数应该保留,但只能作为中间指标。
为什么引用清单不等于证据清单?
生成式回答通常同时呈现正文与若干来源链接。用户容易据此认为:每个链接都支持答案中的相关结论,引用次数越多,页面对答案的影响就越大。
实际过程可能更复杂:系统可能检索多个页面,只选择其中一部分作为可见来源;被列出的页面可能只支持背景信息,没有支持品牌、型号或性能结论;答案也可能综合多个来源,导致单个链接与具体声明之间的对应关系不清晰。
2026 年 4 月发布的预印本研究 From Citation Selection to Citation Absorption 将这个问题拆成两个阶段:
- 引用选择(citation selection):平台是否触发搜索,并把某个页面选入可见来源;
- 引用吸收(citation absorption):被引用页面是否向最终答案贡献了语言、事实、证据、结构或推理支持。
研究分析了 ChatGPT、Google AI Overview/Gemini 和 Perplexity 上的 602 个受控问题、21,143 条有效检索层引用和 18,151 个成功抓取页面。结果显示,引用广度与引用深度并不相同:Perplexity 和 Google 平均引用更多来源,ChatGPT 引用较少,但在成功抓取的页面中表现出更高的平均引用影响。
这项研究仍是预印本,数据来自固定实验集,不能直接解释所有行业和当前版本平台。但它提出了一个重要测量问题:页面出现在来源列表中,与页面真正塑造答案,是两个不同结果。
AI 搜索中的“可见”至少包含五个阶段
结合 2026 年的研究与平台报告,企业可以把 GEO 测量拆成五层,而不是寻找一个统一排名。
| 阶段 | 需要回答的问题 | 可观察证据 | 常见误判 |
|---|---|---|---|
| 发现与检索 | 页面是否可抓取、可索引,并进入相关检索集合 | 抓取日志、索引状态、grounding query、搜索曝光 | 页面可访问就一定会被使用 |
| 引用选择 | 页面是否作为来源出现在答案中 | 引用网址、被引用页面、引用频次 | 被引用就代表支持全部结论 |
| 内容吸收 | 页面中的哪些事实、数字或解释进入答案 | 答案与来源的声明级对应关系 | 引用次数等于影响强度 |
| 表达准确 | 品牌、产品、条件和限制是否被正确复述 | 事实准确率、条件保留率、冲突声明 | 出现品牌名称就是有效曝光 |
| 商业结果 | 用户是否进一步验证、访问或采取行动 | 品牌搜索、合格访问、转化与销售反馈 | 没有点击就没有影响,或有引用就有收入 |
这五层之间没有自动传递关系。页面被检索不保证被引用,被引用不保证内容被吸收,被吸收也不保证表达准确或产生商业结果。
2026 年的新平台报告测到了哪一层?
Google Search Console 的生成式 AI 表现报告开始为部分网站提供 AI Overviews、AI Mode 和 Discover 生成式功能中的曝光、页面、国家、设备与时间数据。这些数据让网站能够从 Google 第一方视角单独观察生成式搜索曝光,但目前不能直接说明页面在答案中贡献了哪项事实。
Bing Webmaster Tools 的 AI Performance提供总引用次数、平均被引用页面、部分 grounding queries、URL 级引用活动和时间趋势。Bing 同时明确说明,这些聚合数据不代表页面在单个答案中的排名、权威度或作用。
两项更新都很重要,因为它们减少了完全依赖第三方模拟问题估算真实曝光的局限。但它们主要覆盖“曝光或引用选择”,不能替代答案级事实核验、品牌描述准确性和后续商业归因。
为什么不能把五层压缩成一个 GEO 总分?
不同平台、问题措辞和运行时间可能改变检索与回答结果。SIGIR 2026 论文 How Generative AI Disrupts Search比较了 Google 自然搜索、AI Overview 与 Gemini,研究使用的代表性查询中,三者检索来源的平均 Jaccard 相似度低于 0.2;AI Overview 对重复运行和轻微问题修改也比传统搜索更不稳定。
2026 年 7 月发布的 GEO 批判性综述进一步检查了 45 项研究。综述认为,GEO 是一条包含检索、重排、引用、突出程度、事实吸收、忠实度与用户行为的随机、部分可观察流程。现有文献能够支持“已被检索的内容可以改变其被引用或使用的概率”,但尚没有被审查的方法证明可以稳定、长期、跨平台地提升自然发现或下游商业结果。
这篇综述同样是预印本,结论会随新研究更新。不过它提醒企业:平台抽样指标适合定位问题和比较变化,不适合包装成一个永久有效的“AI 总排名”。
内容结构有用,但不是引用捷径
引用吸收研究观察到,高影响页面往往更长、结构更清楚、主题更匹配,并含有更容易提取的定义、数字、比较和操作步骤。其他 2026 年实验也在研究页面结构与引用概率之间的关系。
这不等于只要增加标题、表格或 FAQ 就能获得引用。结构主要解决“信息是否容易定位和核验”,无法替代页面进入检索集合所需的主题相关性、抓取与索引,也无法创造企业原本没有的证据。
Google 的生成式搜索官方指南明确表示,网站不需要为了 Google AI 搜索创建特殊 AI 文件、专用结构化数据或细碎内容块,也不需要为每种可能的查询变体重写页面。Google 建议继续使用基础 SEO,提供独特、非同质化、面向用户的内容,并保持页面技术结构清晰。
两类结论并不冲突:Google讨论的是网站在其搜索系统中的整体资格与长期质量;结构实验通常研究内容已经进入检索或上下文后,哪些特征会改变引用或使用。企业应改善可读性和证据组织,但不应把结构当成绕过发现、可信度和真实内容的技巧。
工业与复杂产品为什么更需要测“吸收”?
工业、SaaS 和数码产品的关键结论经常依赖型号、版本、工况、兼容性、认证地区或测试条件。此时,“引用了官网”仍可能掩盖事实错误。
例如,回答引用了一家企业的产品系列页,却给出了某一型号的温度范围。如果系列页没有该数字,答案可能来自另一份文档、经销商页面、模型既有信息或无依据扩写。只记录一次官网引用会把这次回答计为正向结果;声明级核验则会继续追问:
- 数字来自哪个具体页面和版本?
- 来源写的是连续工况、峰值还是测试条件?
- 答案是否保留了型号、地区和适用限制?
- 同一结论在官网、手册和外部信源之间是否一致?
对复杂产品来说,吸收测量的价值不只是争取更多引用,更是发现公开资料是否足以支持一个可靠答案。
企业可以怎样建立声明级 GEO 测量?
第一步是保留完整的测试条件。记录平台、模型或产品入口、国家、语言、时间、完整问题、必要上下文和全部回答,不能只保存品牌名称或截图中的一个片段。
第二步是重复测试并保留问题变体。同一核心任务应使用若干语义相近的表达,在多个时间点运行。重复结果用于观察方向和波动,不能被解释为平台内部的固定排名。
第三步是建立“答案声明—来源证据”映射。把影响选型和信任的关键声明逐项标记为:
| 核验状态 | 判断标准 |
|---|---|
| 直接支持 | 引用页面明确支持该声明,并保留了适用条件 |
| 条件支持 | 来源支持部分结论,但答案省略了型号、版本或限制 |
| 来源错配 | 页面与品牌相关,却没有支持相邻的关键声明 |
| 无法确认 | 当前可见来源不能追溯答案中的事实 |
| 相互冲突 | 官网、文档或外部信源对同一事实给出不同版本 |
第四步是分别报告指标。至少区分品牌提及率、官网引用选择率、关键声明支持率、描述准确率、平台与时间波动,以及与品牌搜索、有效访问或销售线索的相关变化。不要把这些字段相加后隐藏为一个无法解释的总分。
第五步是把问题分配给正确负责人。抓取与索引问题交给网站技术负责人;型号、参数和适用边界交给产品或工程;认证、案例和评价交给合规及对应业务责任人;外部信源差距只能通过真实合作、真实使用和真实证据改善。
引用减少点击后,测量还需要看什么?
Pew Research Center 对 2025 年 3 月美国用户行为的研究发现,出现 Google AI 摘要时,用户在 8% 的访问中点击传统搜索结果;没有摘要时为 15%。用户点击摘要自身来源链接的比例约为 1%。这组数据有明确的国家、时间与采集方法限制,不能直接当作所有行业当前点击率。
它仍然说明,仅用来自 AI 的直接访问可能低估答案阶段的品牌影响;反过来,引用增长也不能自动证明品牌认知或收入增长。企业需要把答案中的提及、引用与准确表达,连接到品牌词搜索、直接访问、后续验证、合格线索和销售反馈,同时披露无法建立因果关系的部分。
研究边界
- 引用选择与吸收框架及 GEO 综述目前属于预印本,尚需更多独立复现与跨行业验证;
- Google 与 Bing 报告展示的是各自产品中的部分第一方数据,不能代表其他平台,也不公开完整检索与生成逻辑;
- 商业系统会随模型、索引、地区、个性化和界面持续变化,固定时间研究不等于当前永久规则;
- 答案与来源之间的语言相似只能作为吸收线索,不能单独证明系统内部的因果使用路径;
- 品牌提及、引用、点击和转化可能同时受到内容之外的品牌认知、渠道、媒体、市场活动与需求变化影响。
对 GEO 测量的实际结论
引用次数不是无效指标,它只是没有完整回答“页面发挥了什么作用”。更可靠的做法,是让每一层都保留自己的证据:用平台报告观察曝光与引用选择,用重复测试观察答案波动,用声明级核验判断事实吸收与准确性,再用企业第一方数据判断是否出现有意义的后续行为。
当企业能够回答“哪项事实在哪类问题中被哪个系统使用、是否表达准确、用户随后做了什么”,GEO 才从展示次数走向可审计的增长实验。