我从去年开始带团队做上海本地的GEO(Generative Engine Optimization,生成式引擎优化)推广项目,接手的第一个客户就抛来一个灵魂拷问:为什么我在AI搜索里问我们行业的问题,给出的回答罗列的全是竞品?我们内容库上万篇,质量不比任何人差,凭什么模型一次都不提我们?
这个问题当时把我噎住了。事后复盘才发现,传统SEO那套“堆关键词、买外链、刷收录”的打法在生成式引擎里基本失效了。AI搜索不给你十条蓝色链接,而是直接生成一段融合多个来源的答案。想在答案里被引用,拼的是内容能不能被大模型识别为“可信、相关、值得引用”的片段。这跟过去优化一个标题标签完全是两码事。整个GEO项目落地的技术链路,就是从“理解引擎如何生成答案”到“让内容适配答案生成逻辑”的反复迭代过程。这篇文章把我跑完这个项目后的技术选型方案和工程落地细节完整写出来,包括大模型查询改写、提示词评估体系、内容质检机制、数据追踪链路和增长闭环验证这几块,希望能给准备入局或正在做的同行省掉一些弯路。
1. 从SEO到GEO:搜索流量逻辑变了,技术栈也要跟着换
先说一个项目启动前必须先想明白的判断:GEO不是推翻SEO,而是把优化目标从“排名第一页”改成“被模型引用为答案来源”。这个转变看起来就一句话,实际会牵动内容生产方式、效果度量标准和数据回收逻辑的全链路重构。
传统SEO里,我们用Search Console看曝光和点击,用关键词工具挖搜索量,只要页面排到前三就算成功。但生成式搜索引擎的返回结果是一个综合答案,用户不会再一一点开十个链接比对,他读完答案就可能完成决策。这就意味着,你过去花力气优化的“落地页排名”已经无法直接转化为曝光。品牌想要在AI答案里出现,本质考验的是你的内容是否存在于大模型训练语料或者检索库中,并且被判定为高相关、高可信的信息源。
我接触的上海本地企业,尤其是做B2B服务、医疗健康、金融咨询这类行业的,对这一变化感受极深。他们的客户已经开始用AI助手做初步选型调研,过去引以为豪的官网白皮书和案例库,在AI回答里根本得不到展示。因为模型倾向于引用那些结构清晰、带权威背书、有明确数据来源的内容,而大部分企业官网的内容是以“自我宣传”为逻辑写的,对模型检索和解析都不友好。
所以在技术选型上,不能照搬SEO外包公司那套“编辑发文章+外推链接”的模式。一个合格的GEO系统至少要包含四个模块:
- 查询理解与改写模块:知道用户在AI搜索中会怎么提问,并把这些提问形态映射到内容生产策略上。
- 内容优化与质检模块:确保生产出来的内容符合模型偏好,包括信息结构、实体标注、来源引用、更新时效都做到位。
- 效果监测与归因模块:对“是否被引用、在哪句话被引用、答案情感倾向如何”做跟踪记录。
- 迭代验证模块:通过周期性实验验证改动是否真的带来了引用率提升。
下面我按这个链路逐个拆解,每一块都结合我们在上海真实跑过的技术方案来说,包括选型思路和踩过的坑。
2. 查询改写模块:先想清楚“向模型提问的变体”,再优化内容不迟
GEO项目启动后第一个技术环节,就是查询改写。很多人以为查询改写是让内容去贴合用户的搜索词,方向确实对,但实际操作远不是做一组同义词替换那么简单。
用户在AI搜索里提问的方式非常多样,同样一个需求,有人会问“上海哪家法律咨询公司靠谱”,有人问“请推荐擅长股权纠纷的上海律所”,还有人问“找律师处理公司合同纠纷需要注意什么”。如果把问题全部抽象成一个核心关键词“上海律师”,就丢失了长尾意图。大模型理解能力很强,它看待一个品牌内容是否匹配问题,看的是语义之间有没有对上下文形成完整的解释链,而不只是看是否包含品牌词。
我们做的第一套查询改写策略是构建一个“领域-问题-证据链”的三层知识框架。以某家B2B工业设备客户为例,先列出领域核心话题(比如“空压机选型”),然后针对每个话题枚举用户在AI搜索中的典型提问变体(“空压机什么牌子质量好”“国产空压机和进口差距大吗”),最后为每个提问变体梳理出模型最可能引用的答案型内容应该包含哪些信息节点(能效等级、售后政策、使用寿命、典型客户案例)。
这一层做扎实后,内容团队再动笔写文章,就不再是“我有什么就写什么”,而是反过来:“模型若被问到这个问题,需要哪些证据作为支撑?”这比让大模型直接生成文章再人工润色要可靠得多,因为大模型生成内容时很容易把行业常识堆在一起,缺少真实案例数据;而GEO内容的核心竞争力恰恰在于那些训练语料里没有的最新项目数据和一手法务信息。
在技术实现上,我们当时用了一套轻量级RAG(检索增强生成)架构来做查询改写辅助。简单说就是先把历史客户咨询记录、行业研究报告、客户官网页全部embedding化存入向量库,当拿到一个新问题时,先向量检索出一批高相关文档片段,再把这些片段喂给大模型,让它判断如果自己是AI搜索引擎,会倾向于总结谁的文档、怎么组织回答。这个“反向模拟”过程帮我们省掉了很多拍脑袋式的选题判断。
这里给出一个用于内部策略分析的提示词模板,核心是让模型扮演搜索引擎答案生成器而不是内容创作者:
你现在是一名AI搜索答案的生成器。用户提问:{question} 你检索到了以下候选资料:{retrieved_docs} 请判断: 1. 哪份资料直接回答了用户问题的核心? 2. 如果只能引用两份资料,你选择哪两份,为什么? 3. 对于未被引用的资料,它们缺少了哪些信息节点,导致其不满足引用条件? 4. 请输出你生成最终答案时拟采用的结构大纲。这个改写和分析流程跑起来之后,我们产出的内容开始有了“被引用思维”,不再是一篇篇孤立的行业稿,而是能够回应具体提问意图的答题卡。但很快又遇到新问题:我们怎么知道改完之后真的有效?这就需要一个系统化的提示词评估机制,不能靠偶尔去ChatGPT问一嘴碰运气。
3. 提示词评估体系:把“品牌是否被AI提起”变成能量化的指标
GEO项目最容易被忽视但又最关键的部分,是提示词评估。AI搜索产品太多了,ChatGPT、Perplexity、Bing Chat,国内还有文心一言、通义千问、豆包这些,每个模型的检索策略、答案组织方式、引用偏好都不一样。同一个问题在A模型里回答了客户品牌,在B模型里可能只字不提。如果没有一套标准化的评估流程,你根本不知道内容优化的方向到底是正确的还是歪的,更没办法向客户交代预算花到哪里了。
我们的做法是自建了一套“GEO可见度评估”框架。核心思路是:针对一个目标客户和一批目标问题,搭建一个固定的问题评估集,然后定期向多个AI搜索引擎提问,捕捉回答中是否出现了客户品牌名,以及出现的位置权重、上下文情感是正面还是中性,最终合成为一个可见度分数。
这里值得详细说说评估问题集怎么建。一开始我们图省事,直接用客户给的三个核心关键词去问,结果答案里品牌出现率很高,客户很开心,但我们都清楚这不能说明真实效果,因为问题太“自嗨”了。后来改成按三类来构造问题集:
- 行业通用问题:例如“螺杆空压机和离心空压机怎么选”,不预设任何品牌倾向;
- 带有竞品对比意图的问题:例如“国产空压机品牌里哪个售后比较好”,这类问题最能反映模型对品牌的综合感知;
- 长尾场景问题:模拟用户真实采购中的具体追问,例如“食品工厂用的无油空压机需要什么认证”。
每个问题会同时投放给不同AI搜索产品,记录结果。因为AI搜索当前的产品变化很快,且容易出现随机性,我们要求同一问题至少在不同时间段各测两次,取一个相对稳定的观测值。
评估完的原始文本要做结构化拆解。我们定义了几个核心指标,每个指标都有对应的量化规则:
| 指标 | 定义 | 得分规则 |
|---|---|---|
| 引用呈现率 | 品牌名是否在答案中出现 | 出现得1分,否则0分 |
| 答案位置权重 | 品牌名出现在全部品牌候选中的次序 | 第1位=1.0,第2位=0.7,第3位及以后=0.4 |
| 上下文情感 | 品牌名前后句子的语义倾向 | 正面=1,中性=0.5,负面=-1 |
| 引用归因深度 | 品牌名是被作为观点引用还是仅被提及 | 带信息引入=1,仅提及=0.3,未出现=0 |
计算可见度得分时,我们会把多个问题、多个模型的得分加权平均后再做归一化处理,最终得到一个百分制分数。这个分数就成为GEO优化是否奏效的核心衡量标准。
自动化评估提示词的写法也需要打磨。我们第一版直接把原始回答丢给大模型让它打分,结果分数虚高,后来加了评判维度要求和打分参照样例,稳定了不少。给你一段我们经过多次迭代后沉淀下来的评估提示词,可以直接拿去改改用:
你是搜索质量评估专家。请阅读以下AI搜索引擎对用户问题的回答,根据规则评估“{brand}”的表现。 回答文本: {answer_text} 判断要求: 1. 品牌是否出现?若出现,请摘录包含品牌名的完整句子。 2. 品牌出现部分的上下文情感是正面、负面还是中性?依据是什么? 3. 品牌在该回答的全部信息贡献度排序中,大概排第几位?若未出现则位置记为0。 4. 该品牌被提到时,是否伴随了具体的服务、产品、资质或案例细节? 请严格按照以下JSON格式输出: {"appeared": true/false, "quoted_sentence": "...", "sentiment": "positive/neutral/negative", "position": 1, "detail_support": true}这块跑起来以后,团队终于告别了“凭感觉说有效”的阶段,每周能拉出一张清晰的报表,告诉客户目前在哪个问题域被引用得多,哪个问题域还是空白。不过,评估结果只是暴露问题,真正要解决的是为什么有些优质内容还是不被引用。这根子往往出在内容质检环节,也就是内容的机器可读性和可信度上。
4. 内容质检:让模型“信得过”之前,先让自己人“挑得出刺”
干GEO项目越久,越能感受到一个残酷事实:编辑觉得好的文章,模型不一定觉得好。模型判断内容是否值得引用,不是看文笔多华丽、金句多密集,而是看这段内容是否结构清晰、信息有出处、实体可识别、且不违反基本事实。如果内容里存在数据不一致或者表述含糊,模型引用出错,会直接影响产品体验,所以模型对内容的“信任门槛”远高于普通读者。
我们做内容质检时自研了一套多层校验流水线。所有要提交给AI搜索引擎做优化处理的内容,在发布前必须过这四关:
第一关是事实正确性核查。这层不能全靠大模型自动把关,因为当前大模型自己就时有幻觉,对着一个错误文本去核查,很容易把对的改成错的。我们的做法是要求内容库在编辑环节就为每个关键数据标注来源,比如“2024年上海市能效监测报告”“客户XX项目验收单”,就算没办法逐字去查原始凭证,也至少要保证数据来源链条是完整的。遇到拿不到源头的信息,宁可删掉也不保留模糊说法。
第二关是机器可解析性核查。这个我强烈建议所有做GEO内容的团队重视起来。模型抓取网页和召回答内容,依赖的是内容结构化的程度。用清晰的小标题把内容切割成能独立理解的片段,段落长度控制在150到200字以内,关键结论前置,核心实体(品牌名、产品名、资质名)使用标准全称而非口语简称。这跟“给读者写”不同,更像是在“给模型写API文档”,每个模块都要能单独被抽出来而不失去语境。
第三关是权威信号核查。模型判定引用来源时,会隐性地权衡信息的权威性。我们经过多轮测试发现,带具体作者身份的内容(例如“拥有15年工业节能改造经验的工程师投稿”)比匿名企业软文被引用概率高不少;带实景案例照片和可查询项目编号的内容比只有产品参数表的内容更容易进入答案的证据链。所以我们的质检流程里加了“作者信息完整性”和“案例可回溯性”两项硬指标,不满足的打回补充。
第四关是合规风险筛查。这一条跟GEO本身关系不大,但一旦出错带来的风险远大于收益。涉及医疗健康、金融投资领域的客户,所有内容里的功效描述、收益承诺都要经过二次人工审核。比如“降低能耗30%以上”这种表述,如果没有权威第三方检测报告背书,很可能构成误导或虚假宣传。我们做内容质检时始终有一条原则:宁可放弃一条可能带来曝口的夸大文案,也不要因为数据造假问题让客户卷入麻烦。
经过这四层质检的内容,基本能保证在“可信度”这一维度拿到较高分,后续再看具体引用率问题时,干扰因素就少得多。但到这里依然只解决了内容供给侧问题,我们还需要追踪发布之后内容在AI搜索答案里的实际命运——这就是数据追踪模块的职责,也往往是项目里最麻烦、最容易被低估的环节。
5. 数据追踪:AI答案里的引用归因,比传统埋点复杂得多
传统网页分析看的是PV、UV、停留时长、跳出率,埋个统计脚本就能跑数据。GEO的数据追踪可没法这么干,因为AI搜索不是我们自己家的产品,我们无法在答案生成过程中植入追踪代码,只能在黑盒外部通过输入问题、观察回答来间接推测。
我在项目之初踩过一个大坑:当时试图用爬虫高频去请求AI搜索引擎接口,希望抓到大量回答数据来评估效果。结果很快触发了平台的反爬机制,IP被限制,还影响了客户账号的正常使用。后来我们收敛成了低频、合规的“人工+半自动”监测机制,一天每个问题最多跑两三轮,用轮换代理加上随机人话化提问间隔。想靠大规模脚本去抓AI搜索数据这条路,在当前阶段非常不划算,我建议后来者不要尝试。
数据追踪模块里真正有价值的是引用归因分析。具体来说,我们不仅记录品牌是否出现在回答中,还会分析是品牌官网的内容被引用,还是第三方媒体转载的内容被引用,或者是行业评论里顺带提到了品牌。这个归因对于指导内容投放非常重要。比如有个客户,我们追踪半个月后发现品牌在AI回答里出现频率不低,但仔细归因,六成以上引用来自百度百科词条和行业协会的会员名单,官网自己的技术白皮书一次都没被引过。这意味着用户的品牌认知来源是很“薄”的,只是在名录层面被知道,并没有解决“为什么应该选你”的问题。
归因分析跑起来后的数据结构大概长这样:
| 时间 | 问题模型 | 问题类型 | 是否提及 | 信息来源 | 上下文片段 | 提及位置 | 情感 |
|---|---|---|---|---|---|---|---|
| 2025-01-15 | 某AI搜索 | 竞品对比型 | 是 | 客户官网-技术白皮书 | “XX公司的永磁变频技术将能效等级提升至一级” | 第1位 | 正面 |
有了这个表,我们就能按周、按月拉出趋势曲线,看不同渠道内容在AI答案中引用份额的变化。追踪过程中,回答结果受模型版本更新的影响很大,同一批问题在一条模型升级前后的答案可能完全不同,所以每次数据看板输出时都要标注模型版本号,不然对比分析很容易失真。
数据追踪的最终目的不是去逐条盯着AI回答,而是为增长闭环验证提供输入。因为只有扎扎实实积累几周、几个季度的追踪数据,你才能用统计口径回答客户最关心的问题:这些优化动作到底带来了多少可衡量的品牌可见度增长?
6. 增长闭环验证:优化动作不是做一次就结束,要设计成可持续迭代的实验
如果说前面几块是在搭骨架,那增长闭环验证就是整个GEO项目的发动机。我们团队内部把它叫“感知-干预-再测-复盘”循环,每个季度跑一轮。
以某次我们为一个医疗器械客户做的内容优化为例,过程是这样的:第一轮感知阶段,我们用前面说的提示词评估体系,在五个AI搜索引擎里测试了42个问题,发现客户品牌的整体可见度得分只有17分,几乎接不到有效的自然流量,大量的相关提问被三个头部竞品垄断。
干预阶段,我们针对失分最多的问题类型集中产出内容,特别注意把所有产品参数、临床试验数据都做了结构化,并补充了来自第三方权威平台的检测报告链接。同时修改了官网上已有的知识中心文章,给每篇都加了发布时间、作者资质和同行评审标注。
再测阶段,内容发布两周后,我们对这42个问题做了同样条件的第二次评估。整体可见度得分从17提升到34,更重要的是原本完全空白的“治疗效果对比型”问题域开始出现了品牌名。虽然跟头部竞品的绝对份额比还有差距,但趋势是正确的,而且来源归因显示,被引用的内容大多是我们的结构化优化版本,而不是碰运气被模型偶然抓到。
复盘阶段,我们发现一个很有意思的现象:模型在不同问题类型上的引用偏好差异巨大。在“产品资质认证类”问题里,模型显然更青睐政府网站和行业协会的公开文件,企业自建站内容再结构化都很难赢过权威信源;但在“选型对比类”问题里,带真实项目案例和一线使用体验的内容则更受模型欢迎。这个发现直接改变了我们的内容策略权重,我们把本来就有限的作者资源更多倾斜到了后者。
做增长闭环验证时,一个容易被忽视的技术点是实验设计的对照组。不要一上来就把所有内容全部改写一遍,那样期未效果归因会很模糊。我们通常的做法是选20到30个核心问题,随机分成两组,一组生产优化内容上线,一组维持原样,其他所有动作一致,一个月后看两个组在可见度指标上的差异。虽然做不到传统AB测试那样严格,但至少为优化动作提供了基本可信的因果判断。
闭环跑顺之后,项目就进入了一个相对稳定的节奏:每周看追踪数据,每月出具评估报告,每季度做一次策略复盘和内容重点重排。到这一阶段,客户看到的不只是“我们发了几篇文章”,而是一套能让品牌在AI搜索里持续积累可见度的增长系统。
写在最后:做GEO项目,必须把模当个不断变化的对手
跑完整个项目,我最想分享的经验只有一句:做GEO,永远不要相信一套配置能管一年。AI搜索引擎的模型迭代、检索策略和引用规则都在快速变化,今天灵验的优化手法,三个月后可能就成了负面信号。所以我们的技术架构从第一天起就刻意保持模块化,查询改写、提示词评估、内容质检、数据追踪都是独立可替换的组件,模型接口尽量做通用封装,方便随时切换不同AI搜索平台。
对于准备在GEO方向投入资源的团队,我的建议是先从一个较小的闭环跑通:选一个细分领域、建一套不少于20个问题的评估集、手工优化10篇左右的高价值内容,然后坚持做至少六周的追踪评估。如果六周后可见度指标没有明显变化,大概率不是技术路线错了,而是执行深度不够。这个领域没有捷径,但每一项工程化打磨都能沉淀为下一轮增长的基础。
最后分享一个小技巧:日常监测时不妨给自己留一个小号角色,专挑那些“不太礼貌、带强烈比较意图”的问题去测试,比如“XX品牌是不是被高估了”。这类负向问题最能暴露品牌内容在AI模型心中的真实地位,也是舆情风险的预警线。比起每天数着正面引用沾沾自喜,我更建议把精力花在这些不够体面却足够真实的提问上。