发布时间:2026-08-29 人气:0次

先讲一个真实的一手实验。
数据可观测性公司 Monte Carlo 曾亲手开创过一个品类,那时候成功的信号都摆在明面上:分析师覆盖、搜索排名、自己的话术出现在别人的方案里。等到他们试图开创第二个品类"智能体信任(agent trust)"时,同样的信号找不到了——形成看法的人不再读他们的网站,而是在问 AI。
于是团队去问了一个自认为稳赢的问题,大意是"AI 智能体可观测性最佳平台"。AI 给出一份干净的名单,来自大约九个来源,名单上没有他们。只有当工具再用"Monte Carlo"这个名字搜一次、把结果合并进来时,他们才出现。
一个只问了第一个问题就停下的买家,永远不会看到这家公司。
这个团队没有停留在抱怨,而是建了一套测量方法:25 个提示词,分成三类买家行为——品牌类("Monte Carlo 是做什么的")、问题类("如何在生产环境中监控 AI 智能体")、对比类("Monte Carlo vs X")——跑过 ChatGPT、Perplexity、Gemini、Grok、Claude、Copilot 六个平台,得到 150 条回复,逐条记录是否被提及、定位是否准确、相对竞品排在哪里,并且回查每一条答案的引用来源。
结果呈现出一个非常清晰的分界线。
在被指名道姓地问、或者问到自家内容已经覆盖过的技术问题时,他们几乎每次都正确出现,AI 显然读过他们的博客和文档,能准确复述定位。问题出在另一类提问上:泛化的发现类问题,也就是买家还没有任何厂商概念时先问的那种——"这个领域哪个工具好"。在这类问题上,他们几乎消失。
而引用来源揭示了真正的原因:回答发现类问题时,平台根本没有引用他们,而是从一小撮第三方"最佳榜单"文章中抓取内容,并复述那些文章的说法。他们自己的页面完全不在那个池子里。
作者写下了这批素材里最锋利的一句话:AI 读的不是你的网站,而是写了那份名单的人,并把那个页面当作真相。
这个实验逼出了一个此前很少有人认真切分的概念——AI 可见度其实是两种东西。
品牌可见度:当别人已经知道你的名字时,AI 能否正确地理解你、准确地描述你。
发现可见度:当别人还不认识你时,AI 会不会主动把你放进推荐名单。
在 Google 时代,这两件事被一并解决了。好的 SEO 既能让你被按名字找到,也能让你被按问题找到,排名靠前同时覆盖了两者。AI 平台打破的正是这种关联——它们仍然能按名字找到你,但对于发现类问题,中间层的内容(评论、对比、榜单、社区讨论)现在比你自己发布的任何东西都更重要。
这个切分之所以重要,是因为两场战争的胜负手完全不同。
第一场的胜负手是可提取性(extractability):你的品牌事实是否以机器能读懂、能定位、能引用的方式组织起来。名称、业务范围、核心能力、关键参数、适用边界,是否跨页面一致、是否有明确的结构标记、是否能被单独摘出来而不丢失语境。这一场是企业自己能打赢的,因为战场在你的自有资产上。
第二场的胜负手是可被引用性(cite-ability):当 AI 需要回答一个它并不掌握答案的发现类问题时,它会去找谁。而它找的通常不是厂商自述,而是第三方已经形成的共识。这一场企业无法直接打赢,只能通过经营"谁在替你说话"来间接影响。
把这两件事混为一谈,是当前大量 GEO 项目失效的根源:企业不断生产内容、优化官网、更新关键词,这些动作全都作用在第一场;而他们真正想要的结果——进入推荐名单——属于第二场。
要理解第二场的难度,需要理解 AI 面对发现类问题时的策略。
当一个买家问"这个领域哪个工具好",模型面对的是一个高度不确定的判断任务。在这种情况下,任何单一来源的自述都不足以支撑结论——因为每个厂商都会说自己好。模型更稳妥的策略,是去寻找多个来源已经达成共识的说法,然后复述它。
这就产生了一个对企业来说相当残酷的结构:你的官网再完美,也只是"一个来源";而一份被多方引用的榜单,代表的是"共识"。
海外的数据把这个结构量化得相当清楚。SaaS 领域的研究显示,当 ChatGPT 在软件推荐中引用评论平台时,G2 及其旗下站点群(Capterra、Software Advice、GetApp)占这类引用的 84%,而且买家越接近购买决策,这个占比越高。也就是说,在最接近成交的那一刻,决定你能不能进名单的,几乎完全取决于你在这些第三方生态里的存在形态。
同样的逻辑在 B2B 侧得到印证。GNW Consulting 与 Demand Metric 对 225 位 B2B 营销与营收负责人的调研发现,受访者对"社区平台与 AI 优化内容"的排名,略高于传统 SEO 手段——业界自己已经意识到,驱动 AI 发现的主要力量不在自己的官网上。
这也是为什么"发够内容就能被推荐"是一个错误承诺。内容量作用在第一场,而第二场的通行货币是第三方共识。
Monte Carlo 这个实验最有价值的部分,不是它成功了什么,而是它诚实地记录了什么没有成功。
第一次审计结束后的几周里,团队开始系统经营这个品类:上线专门的 Agent Trust 页面,围绕品类重新命名并设计博客,在他们控制的每一个界面上用一致的方式讲述同一件事,并且为"agent trust"这个词拿到了一页自然搜索排名——这一点很关键,因为自然搜索正是这些平台决定抓取什么时的信号之一。
然后他们重跑了测试(这次是五个平台,去掉了没有带来可衡量推荐流量的 Grok)。
发生变化的是第一场。 过去把他们归入泛泛的"数据平台"的平台,开始在他们被问及"谁在定义 agent trust"时第一个点他们的名;在其中一个平台上,被指名提到的频率翻了一倍多。
毫无进展的是第二场。 用作者自己的话说:他们在"平台如何描述我们"上取得了进展,但在"平台从哪些榜单取材"上毫无进展。
这个负面结果的分量,超过市面上绝大多数 GEO 成功案例。它划出了一条清晰的能力边界:企业可以对自己说什么负责,但无法直接决定 AI 去读谁。任何声称"做完内容就能进推荐名单"的方案,要么不懂这个机制,要么在回避它。
作者本人的态度也值得尊重——他明确声明不会把这归功于自己,因为模型会重新训练、网络会变化,无法把自身行动与同期发生的一切干净地分离开。这种克制,恰恰是当下 GEO 行业最稀缺的品质。
海外的发现类查询高度依赖成熟的评论与榜单生态(G2 系那 84% 就是证明)。中国市场的情况不同,但机制一样——关键在于弄清楚:在你的行业里,AI 回答"哪家靠谱"时,究竟在引用哪些页面。
就目前的观察,国内喂养 AI 的第三方语料大致分布在几类地方:行业垂直站点与 B2B 平台的评测、榜单类内容;知乎等问答社区里被反复引用的长回答;百科类词条构成的基础事实层;地方媒体、行业媒体的报道;以及像搜狐号、头条号这类被高频抓取的自媒体信源。不同行业的组合差别很大——工业制造类可能重度依赖垂直站与商查平台,消费服务类则更依赖本地口碑与点评内容。
这里有一个容易被忽略的判断标准:不是"这个平台流量大不大",而是"这个平台的内容会不会被 AI 当作来源引用"。 一个流量平平但结构清晰、事实密集、被多方转载的行业页面,对发现可见度的贡献,可能远高于一篇发在你自己公号上的十万加。
因此,做第二场的第一步不是写内容,而是做一次来源盘点:在你的核心品类词下,把 AI 给出的答案全部展开引用来源,统计它们来自哪几个域名。这份域名清单,才是你真正的竞争对手名单——它和你以为的竞争对手,往往不是同一批。
理论说清楚之后,落到可执行的一步。下面这套方法成本极低,任何企业今天就能做。
第一步:双问测试。 选三到四个你的买家真的会用的平台。每个平台问两个问题:一个带品牌名的("XX 公司是做什么的""XX 怎么样"),一个不带品牌名的同义泛化版本("重庆做 XX 哪家靠谱""XX 设备选哪个牌子")。问完之后追加一句"请给出你的信息来源"。
第二步:看结果的四种形态。
· 品牌问出现、泛化问也出现:两场都在赢,保持监测即可,重点是防止回退。
· 品牌问出现、泛化问消失:这是最常见的形态,也就是 Monte Carlo 遇到的差距——第一场打完了,第二场还没开始。
· 品牌问出现但描述错误或不完整:第一场就没打好,问题出在品牌事实的机器可读性上,而不是内容量。
· 两个都不出现:基础信息层缺失,AI 手里根本没有关于你的可靠语料。
第三步:针对第一场,做结构化事实整理。 把企业的核心事实——名称、业务范围、服务能力、关键参数、资质、适用边界——组织成机器可读取且跨平台完全一致的形式,并用结构化标记落到官网上。这一步的本质是让 AI 在"被点名时"能准确、完整、稳定地复述你。这也是传粉科技在为企业搭建知识图谱时反复强调的一点:核心事实必须能被验证、被交叉核验,否则一致只是表面一致,经不起 AI 的多源比对。
第四步:针对第二场,经营来源而不是经营数量。 把第五步得到的域名清单变成工作目标——让那些真正被 AI 引用的第三方页面里,出现关于你的准确、具体、可验证的信息。注意这里的关键形容词:具体且可验证。一条泛泛的"服务很好"评价,价值远低于一条点明了具体用例、具体场景的评价,因为后者提供了 AI 无法从别处获得的信息增量。
如果可见度是两场战争,指标就不能只有一个分数。
第一场对应的是准确性指标:被提及时定位是否正确、关键事实是否被准确复述、与竞品并列时的表述是否恰当。这一层可以通过固定提示词组定期采样来跟踪。
第二场对应的是出现率指标:在泛化发现类问题上,你进入名单的比例是多少;名单上的其他品牌是谁;你被排在第几位。这一层的波动通常比第一场慢得多,也更难归因。
把两个指标分开看,至少有三个实际好处:一是能说清楚投入到底改善了什么,而不是用一个总分掩盖结构性问题;二是能对客户诚实——第一场见效快,第二场需要经营周期,提前讲清楚比事后解释好;三是能识别虚假进展,如果一个项目只推高了总分、两层的具体表现都没变,那很可能是采样或模型波动造成的噪声。
GNW 的调研里有一个数字值得所有做这件事的人记住:尽管各营销团队普遍在开展 GEO 相关行动,但只有不到 15% 的组织设有专职的 GEO 负责人。没有专人持续观察,两场战争的比分就永远是一笔糊涂账。
回到开篇那个判断:AI 搜索带来的不是一场排名竞争,而是两场机制不同的战争。
第一场争夺的是"被说对",战场在自有资产,胜负手是事实的机器可读性与跨平台一致性,企业可以自己打赢,见效也相对快。第二场争夺的是"被提上名单",战场在第三方语料,胜负手是你是否出现在那些被 AI 当作共识来源的页面里,企业只能间接经营,周期长且难以简单归因。
大多数企业的问题在于:用第一场的动作,去等第二场的结果。
而区分这两件事,恰恰是当前 GEO 服务里最容易被含糊过去的地方。所有的工作都被装进"AI 可见度"这一个词里,用一个分数呈现,最后既说不清改善了什么,也无法解释为什么投入没有换来推荐位。
真正专业的做法,是先把两场战争分开测量,再分开投入,并且诚实地告诉客户哪一场能承诺、哪一场只能经营。
GEO 和 SEO 最大的区别是什么?
SEO 优化的是"在结果列表里排第几",GEO 面对的是"AI 会不会把你写进答案"。更关键的差别在于,SEO 里排名靠前可以同时解决被按名字找到和被按问题找到;而在 AI 搜索里这两件事被拆开了,需要分别投入。
为什么我们发了很多内容,AI 还是不推荐我们?
很可能是两场战争里只打了第一场。内容量和官网优化主要提升"被点名时的准确性",而"被推荐"取决于你是否出现在 AI 引用来源的那些第三方页面里。建议先做双问测试确认差距形态,再决定投入方向。
第二场是不是完全不可控?
不是不可控,而是不可直接控制。你无法命令 AI 引用某篇文章,但可以通过盘点引用来源、让准确且具体的信息进入那些被高频引用的第三方页面,来间接改变它取材的池子。这个过程需要经营周期,且难以做单点归因。
中小企业现在做这件事来得及吗?
从调研数据看,92% 的组织已在试验或落地 GEO,但只有不到 15% 设有专职负责人,说明多数仍处于无序尝试阶段,窗口并未关闭。中小企业的现实路径是先低成本完成自查与事实结构化,再按引用来源清单逐步经营,而不是一开始就做大规模内容生产。
数据来源与边界声明
本文核心实验与观点引自 Monte Carlo 于 2026 年 8 月 24 日更新的《How We Measure What LLMs Actually Say About Us: An LLM Visibility Audit》,该实验为单一企业的一手自测(25 个提示词 × 6 个平台 = 150 条回复,复测为 5 个平台),作者本人明确声明无法将自身行动与模型重训练、网络变化等变量干净分离,因此其结论应视为方向性证据而非普适规律。
文中引用的 SaaS 评论平台引用占比(84%)来自 Siteimprove 的分析,需注意该公司本身销售 AEO 监控产品;B2B 调研数据(225 份样本、88% 的代理机构提供 GEO 服务其中 37% 定义松散、22% 的 AI 流量占比超过 5%、不足 15% 设有专职负责人)来自 GNW Consulting 与 Demand Metric 的《2026 年 B2B 营销中的生成式引擎优化现状》,发布方设有 GEO 业务,存在立场。