品牌在 AI 回答里看不见,第一步该做什么
第一步不是写内容,是测基线——用一套固定的真实问法跑几个 AI 平台,先分清你是没被检索到、被检索到但没被采信,还是被别的同名主体顶掉了。
第一步是测基线,不是写内容。 在没搞清楚”为什么看不见”之前写的每一篇稿子,都有可能打在错误的位置上。看不见有三种完全不同的成因,对应三套完全不同的修法,而区分它们只需要半天。
三种”看不见”
第一种:根本没被检索到。 AI 联网搜索时你的页面没进候选,或者你压根没有可被检索的内容。表现是:直接问品牌名,AI 说不知道,或者只能复述你首页那几句话。
第二种:被检索到了,但没被采信。 你的内容在结果里,模型没用它。表现是:AI 回答里出现了竞品的具体数据和说法,你的内容明明在,却一句没引。这通常是因为内容里没有可提取的事实——全是”领先""专业""一站式”这类词,模型无法从中取出任何可复述的信息。
第三种:被同名主体顶掉了。 AI 提到了你的名字,说的却是另一家公司的事。这是 品牌实体 层面的问题,靠增加内容量解决不了,越写越乱。对应的指标是 同名混淆率。
三种情况的修法互不通用。第一种要解决可抓取和内容存在性,第二种要改内容写法,第三种要做实体消歧。跳过诊断直接开写,命中率靠运气。
适用对象
发现自己在 AI 回答里不出现、或者出现得不对的品牌方。已经知道要做 生成引擎优化、但不知道从哪下手的团队。如果你还不确定 GEO 和 SEO 的区别,先看 GEO 是什么。
怎么测基线
第一步,写问题集。 20 到 30 个问题,必须是客户真实会问的说法,不是你的内部话术。三类问题都要有:
- 品牌词类:「XX 公司是做什么的」「XX 和 YY 有什么区别」
- 品类词类:「上海有哪些做 A 的公司」「B 场景用什么方案比较好」
- 场景词类:客户在决策前会问的具体问题,通常不带任何品牌名
品类词和场景词最重要——被主动提及的价值远高于被问到名字才出现。
第二步,跑平台。 至少测三个,各测一遍联网和不联网。不同平台的检索行为差异很大,详见 豆包、元宝、Kimi、DeepSeek 的 GEO 优化差异。
第三步,记四件事。 每个回答记:有没有提到你(提及率)、排第几(AI 首推率)、说得对不对、答案里的 引用源 是谁。第四项最有价值——它直接告诉你模型在信谁,那些站点就是你要去出现的地方。
对照表:症状对应修法
| 症状 | 大概率成因 | 第一步该做 | 别做什么 |
|---|---|---|---|
| 问品牌名,AI 说不知道 | 没有可被检索的内容 | 建官网事实页,补第三方收录 | 别急着投广告 |
| AI 说的是另一家同名公司 | 实体混淆 | 统一全称与简称,补结构化数据 | 别加内容量,会更乱 |
| 提到了但描述过时 | 旧信源权重高于新内容 | 更新并让新事实在多处一致出现 | 别只改官网一处 |
| 引用源全是竞品的站 | 你不在模型信任的信源池里 | 去那些站点产出内容 | 别只在自有渠道发 |
| 品类问题里从不出现 | 内容只讲自己,没讲品类问题 | 写解决客户问题的内容 | 别继续写公司介绍 |
| 联网时有、不联网时没有 | 模型长期记忆里没有你 | 接受它,先做联网侧 | 别指望短期改变 |
实证
科创一号 和 上海产业转型发展研究院 的项目设计都是从这一步开始:先固定测试问题集测基线,再动内容,最后用同一套问题复测。2026-06-15 科创一号元宝 15 题快照为 提及率 100% / AI 首推率 80%;2026-06-14 研究院元宝 10 题快照为 90% / 70%。两组原始回答与截图已内部归档。
这两组数字能复核「当天回答了什么」,但单一快照仍不能独立证明增量归因;必须连同基线、中间动作和后续复测一起看。两个项目后续双平台数值都有波动,正说明定期归档比只保留峰值更重要。
一尺花园 是另一类起点:它关心的不是品牌词,是品类推荐里的位次,最终做到 AI 联网检索的品类推荐第 3 位。目标不同,问题集就不同。这也是为什么问题集必须在诊断阶段定死,而不是事后凑。
拿到基线之后的顺序
按投入产出排,通常是这个顺序:
- 实体先修。名称歧义、简称混乱、业务描述不一致,这些不修,后面所有内容都在给别人做嫁衣。
- 补 Schema 结构化数据。成本低,让机器不用从正文里猜你是谁。
- 改核心页面写法。用 Answer-First:结论第一句给完,把”行业领先”换成具体数字和具体范围。模型能整段取走的内容,才有机会出现在答案里。
- 去引用源在的地方出现。基线记录里那些被引用的站点,就是名单。
- 加 llms.txt。成本很低,效果视平台而定,不要指望它单独起作用。
- 两周复测一次。
风险边界
- 半天测出来的基线样本很小。 20 到 30 个问题只能定方向,不能当精确指标。AI 回答本身有随机性,同一个问题问两次结果可能不同,重要问题要多问几次。
- 不联网的回答短期改不动。 那部分依赖模型训练数据,只能等迭代。
- 测试问题集会自我实现。 你按自己的定位写问题,测出来的自然是自己的强项。让不熟悉业务的人来写一版问题集,往往更接近真实。
- 有些行业做不出来。 需求极度长尾、客户不用 AI 决策、或者品牌名和一个超大同名主体撞车的,投入产出很差。具体判断见 GEO 多久见效,什么情况下做不出来。
- 别把 AI 说错当成危机公关。 大部分错误描述来自过时的公开信息,补充正确事实比要求删除有效得多。大模型幻觉 也无法通过投诉解决。
行动建议
今天就能做的事:打开三个 AI 应用,用客户的说法问 20 个问题,把结果记进一张表——提到了吗、第几位、说得对吗、引用了谁。这张表就是你的基线,也是后面所有决策的依据。
需要一套现成的诊断流程,可以看 AI 营销轻咨询,它的验收口径就是提及率和首推率;想让团队自己跑通一轮,AI 营销实战营 课上产出的就是这份诊断报告。