☰
货拉拉大模型营销文案落地:Agent架构与合规实践
2026/9/29 21:55:29 网站建设 项目流程

1. 货拉拉营销广告场景下的大模型落地思路

货拉拉的营销广告业务有个很鲜明的特点:双边市场、强地域属性、高频低客单。司机端要拉新、促活、留存,货主端要拉新、复购、唤醒,再加上同城货运本身是"即时需求"驱动的,用户往往在需要搬东西、拉货的那一刻才会打开App。这就决定了它的广告投放和内容营销不能像电商那样"广撒网慢慢养",而是要在极短的时间窗口里,用最贴切的话术、最合适的渠道、最精准的人群,把用户拉回来。

传统做法是什么?运营同学拉一张人群包,写几套文案,交给投放同学去跑,跑完看数据,好的留下、差的砍掉。这套流程的问题在于:文案产能跟不上人群细分速度。货拉拉的人群标签维度非常多——城市、车型(小面包/中面包/4.2米货车)、货主身份(个人/商户/企业)、历史下单频次、常用路线、甚至是否在装修季、毕业季这种特殊节点。如果每个细分人群都要配一套文案,运营同学一天写50条就到顶了,但实际需要可能是500条甚至5000条。

大模型进来之后,最直接的改变就是把"文案生产"从手工作坊变成了流水线。但这里有个误区,很多人以为接个大模型API,写个prompt让它批量生成文案就完事了。实际做下来会发现,裸调大模型生成的营销文案有三个致命问题:一是不懂业务,它不知道"小面包"和"中面包"在货拉拉体系里对应什么场景;二是不懂合规,广告法对"最""第一""绝对"这类词有硬性限制,大模型不管这些;三是不懂转化,它写出来的文案读着通顺,但缺少钩子,用户看完没有点击欲望。

所以货拉拉这套实践的核心思路,不是"用大模型替代人",而是用大模型做规模化生产,用人做规则约束和质量兜底。具体来说,整个链路拆成四层:

  • 第一层是业务知识注入。把货拉拉的车型体系、计价规则、服务承诺、各城市运营重点,整理成结构化的知识库,作为大模型生成时的上下文。这一步解决"懂业务"的问题。
  • 第二层是提示词工程与模板约束。针对不同广告位(开屏、信息流、短信、Push、朋友圈)设计不同的prompt模板,把字数限制、必含要素、禁用词清单都写进去。这一步解决"懂合规"和"懂格式"的问题。
  • 第三层是AI智能体(Agent)编排。不是单次调用大模型,而是搭一个工作流:先做人群画像分析,再选文案策略,然后生成候选文案,接着做合规校验,最后打分排序。这一步解决"懂转化"的问题。
  • 第四层是人工审核与A/B测试闭环。生成出来的文案不是直接投,而是进审核队列,人工快速过一遍,然后小流量测试,数据回流后再优化prompt和知识库。这一步解决"持续变好"的问题。

这套思路听起来不复杂,但真正落地的时候,坑非常多。下面我按模块拆开讲,把每个环节的关键细节和实操经验都摊开说。

1.1 为什么选Agent架构而不是单次大模型调用

先回答一个很多人会问的问题:为什么非要搞Agent,直接调大模型API批量生成不行吗?

我试过直接调,效果是这样的:给大模型一个prompt"帮我写20条货拉拉拉货广告文案,面向搬家用户",它确实能写出来,但20条里有15条是"货拉拉,搬家拉货更轻松"这种换汤不换药的表达。因为单次调用时,大模型是在一个"扁平"的上下文里做概率采样,它没有"先分析再生成"的思考步骤,也没有"生成后自检"的机制。

Agent架构的本质是把一个大任务拆成多个有依赖关系的小任务,每个小任务由大模型或规则引擎独立完成,中间结果可以互相校验。在货拉拉这个场景里,Agent的工作流大概是这样:

  1. 人群理解节点:输入是人群包ID和对应的标签描述,输出是这个人群的"核心痛点"和"沟通策略"。比如"近30天未下单的搬家用户",痛点是"可能已经找到其他方式搬家了,需要唤醒",策略是"强调优惠+降低决策门槛"。
  2. 策略选择节点:根据人群痛点和广告位类型,从策略库里选一个最合适的文案框架。比如短信渠道适合"短平快+强行动指令",朋友圈广告适合"场景共鸣+品牌好感"。
  3. 文案生成节点:把策略框架、业务知识、禁用词清单一起塞进prompt,让大模型生成N条候选。
  4. 合规校验节点:用规则引擎+小模型做双重校验,规则引擎查禁用词,小模型判断语义是否违规(比如暗示"最便宜"但没用"最"字)。
  5. 质量打分节点:用另一个大模型调用(或者同一个模型的不同prompt)对候选文案打分,维度包括相关性、吸引力、行动号召力、品牌调性一致性。
  6. 排序输出节点:按综合得分排序,取Top K进入人工审核。

这个工作流跑下来,文案的可用率能从裸调的20%提升到70%以上。多出来的这些调用成本,相比人工写文案的时间成本,完全划算。

1.2 业务知识库怎么建才不白建

知识库这块,我见过太多团队踩坑:花两周整理了一个巨大的文档,结果大模型根本用不上,因为检索的时候要么召回不准,要么召回的内容太长把上下文撑爆了。

货拉拉的做法是分层建库+按需检索。具体分三层:

  • 静态知识层:车型介绍、服务范围、计价规则、品牌话术规范。这部分内容相对稳定,做成结构化JSON,每个条目带标签,检索时按标签精确匹配。
  • 动态知识层:各城市的运营活动、当前补贴政策、季节性营销主题。这部分更新频繁,用表格维护,每天同步一次。
  • 案例知识层:历史跑量好的文案、审核被拒的文案、用户投诉的文案。这部分最有价值,因为它包含了"什么能说、什么不能说、什么说了有效"的隐性知识。

检索的时候,不是把整个知识库塞给大模型,而是根据当前任务(人群+渠道+目标)做一次轻量检索,只取最相关的3-5条。这里有个经验:知识条目的粒度要细,最好一条就是一个独立事实。比如"小面包车适合1-2人小型搬家,载货空间约2立方米"就是一条,不要写成一大段"货拉拉车型体系介绍"。

提示:知识库的更新频率要跟业务节奏对齐。货拉拉在毕业季、春节前这种节点,运营策略变化很快,知识库如果一周才更新一次,大模型生成的内容就会"过时"。

2. 核心细节解析:提示词、合规与质量打分

2.1 提示词工程在营销文案场景的特殊打法

通用的提示词工程原则(角色设定、任务描述、输出格式)在这里都适用,但营销文案场景有几个特殊点需要额外处理。

第一,必须给"反面例子"。大模型对"不要做什么"的理解,远不如对"要做什么"的理解。所以prompt里除了写"文案要突出优惠力度",还要写"禁止出现'最''第一''绝对''100%'等极限词,禁止承诺具体到达时间,禁止贬低同行"。实测下来,给了反面例子之后,违规率能降一半。

第二,要控制"创意发散度"。营销文案需要一定的多样性,但多样性太高会导致品牌调性失控。我们的做法是在prompt里指定"文案风格标签",比如"亲切口语""专业可靠""紧迫感强",每次生成时随机选2-3个风格标签组合,这样既有多样性,又在可控范围内。

第三,输出格式要强制结构化。不要让大模型自由发挥,而是要求它按JSON输出,每个候选文案带"文案内容""适用人群""风格标签""预估点击理由"四个字段。这样后续的合规校验和打分节点才能程序化处理。

一个实际用的prompt模板大概长这样(简化版):

你是货拉拉的营销文案专家。当前任务是为【{人群描述}】生成【{渠道}】广告文案。 业务背景: {检索到的知识条目} 文案要求: 1. 字数限制:{渠道字数要求} 2. 必含要素:{必含要素列表} 3. 风格标签:{随机选中的风格标签} 4. 禁止事项:禁止使用极限词、禁止承诺具体时间、禁止贬低同行 请生成{ N }条候选文案,按以下JSON格式输出: [ { "content": "文案内容", "target_audience": "适用人群", "style": "风格标签", "reason": "预估点击理由" } ]

这个模板的关键在于把变量和常量分离。常量部分(业务背景、禁止事项)每次调用都一样,可以放在system prompt里;变量部分(人群、渠道、风格)每次动态填充。这样既保证了稳定性,又保留了灵活性。

2.2 合规校验:规则引擎和小模型的双保险

广告合规是红线,不能全靠大模型自觉。货拉拉的做法是规则引擎做硬拦截,小模型做软判断。

规则引擎这块比较直接,维护一个禁用词库,包括广告法明令禁止的极限词、货拉拉内部规定的敏感词、各渠道平台的特殊限制词。文案生成后先过一遍规则引擎,命中就直接打回。这里有个细节:禁用词要做变体匹配。比如"最便宜"要拦截,"最 便宜""最便 宜""蕞便宜"也要拦截,不然很容易被绕过。

小模型这块是补充规则引擎的不足。有些文案没有命中禁用词,但语义上有问题。比如"货拉拉帮你把东西搬得比谁都快",没有极限词,但暗示了"比同行快",属于不正当竞争。这种就需要一个小模型(或者用大模型加特定prompt)来判断。我们的做法是训练一个二分类小模型,输入文案,输出"合规/不合规/待人工确认"三分类。训练数据来自历史审核记录,准确率能做到90%以上,剩下的10%进人工审核。

注意:合规校验不能只做一次。文案在生成节点校验完,进入打分节点后如果被修改(比如为了凑字数调整了措辞),要重新校验。我见过因为漏了这一步导致违规文案上线的案例,教训很深刻。

2.3 质量打分:怎么让大模型判断"哪条文案更好"

质量打分是整个链路里最"玄学"的部分,因为"好文案"本身没有绝对标准。我们的做法是把主观判断拆成可量化的维度,让大模型逐项打分,最后加权求和。

具体维度包括:

维度说明权重
相关性文案是否切中目标人群的核心需求30%
吸引力是否有让人想继续读/点击的钩子25%
行动号召力是否有明确的下一步指令20%
品牌调性是否符合货拉拉"可靠、亲切、高效"的调性15%
信息完整度是否包含了必要的业务信息(如优惠、车型)10%

打分时,把候选文案和打分标准一起给大模型,让它输出每个维度的分数(1-5分)和简短理由。这里有个技巧:让大模型先写理由再打分,而不是直接打分。因为"先写理由"会迫使它做更深入的语义分析,打出来的分更靠谱。实测下来,先写理由的打分一致性比直接打分高30%左右。

打分完成后,按加权总分排序,取Top 5进入人工审核。人工审核不是从头看,而是重点看"大模型打分高但人工觉得一般"和"大模型打分低但人工觉得不错"的case,这些case是优化prompt和打分标准的最佳素材。

3. 实操过程:从人群包到广告上线的完整链路

3.1 人群包接入与画像解析

整个链路的起点是人群包。货拉拉的营销系统里,人群包由数据团队产出,每个包有一个ID和一组标签描述。Agent要做的第一件事,是把这些标签"翻译"成大模型能理解的自然语言描述。

比如一个原始人群包标签是:city:shanghai, user_type:personal, last_order_days:30-60, order_type:move。翻译成自然语言就是:"上海地区、个人货主、最近一次下单在30-60天前、历史订单类型为搬家"。

翻译完之后,还要做一步痛点推断。这一步可以用大模型做,也可以查预置的规则表。比如"30-60天未下单的搬家用户",痛点推断是"可能已经完成搬家,或者找到了其他替代方案,需要唤醒或挖掘新需求"。这个痛点推断结果会作为后续策略选择的输入。

这里有个实操经验:人群包不要太大。如果一个包覆盖几百万人,生成一套文案投出去,效果很难归因。我们的做法是把大包拆成小包,每个小包控制在10-50万人,每个小包单独生成文案、单独投放、单独看数据。这样虽然管理成本高一点,但优化迭代的速度快很多。

3.2 策略选择与文案框架匹配

策略选择节点本质上是一个"路由"逻辑:根据人群痛点、渠道类型、营销目标,从策略库里选一个最合适的文案框架。

策略库是我们人工维护的,大概有20-30个框架,每个框架定义了文案的结构和重点。举几个例子:

  • 唤醒框架:适合长期未下单用户。结构是"好久不见+专属优惠+行动指令"。示例:"好久没叫货拉拉了,送你一张8折券,今天下单立减。"
  • 场景框架:适合有明确场景需求的用户。结构是"场景描述+解决方案+行动指令"。示例:"搬家东西太多?货拉拉小面包车,一车搞定,随叫随到。"
  • 紧迫框架:适合促销活动期。结构是"限时信息+优惠力度+行动指令"。示例:"今日最后一天,货拉拉搬家券5折抢,错过等一年。"
  • 信任框架:适合新用户。结构是"品牌背书+服务承诺+行动指令"。示例:"货拉拉,全国300城覆盖,百万司机在线,搬家拉货放心叫。"

策略选择节点用大模型做,prompt里把人群痛点、渠道类型、可选框架列表都给进去,让它选一个并说明理由。实测下来,大模型选框架的准确率大概80%,剩下20%会在人工审核时被调整。这个准确率已经够用了,因为即使选错框架,后面的文案生成和打分环节还有机会纠正。

3.3 文案生成与批量处理

文案生成节点是整个链路里调用量最大的。一个中等规模的投放活动,可能需要生成几千条候选文案。这里要考虑两个问题:成本和速度。

成本方面,我们用的是"大模型生成+小模型初筛"的组合。大模型负责生成高质量的候选,小模型负责快速过滤掉明显不合格的(比如字数超了、格式错了)。这样大模型的调用量可以控制在合理范围内。

速度方面,批量生成时用异步调用,不要一条一条同步等。我们的做法是把生成任务拆成批次,每批50条,并发调用,整体生成时间从原来的几十分钟压缩到几分钟。

生成出来的文案,先过格式校验(JSON是否合法、字段是否齐全),再过合规校验,然后进打分节点。这里有个细节:打分节点和生成节点可以用不同的模型。生成用能力强的模型,打分用速度快、成本低的模型,这样整体成本更优。

3.4 人工审核与A/B测试闭环

人工审核这块,我们的原则是**"快审+抽检"**。快审是每条文案人工过一眼,主要看有没有明显的语义问题、品牌调性问题;抽检是每天随机抽10%的文案做深度审核,看大模型的打分和人工判断是否一致。

审核通过的文案,进入A/B测试环节。测试设计有几个要点:

  • 对照组要合理:不能只测大模型生成的文案,还要留一组人工写的文案做对照,这样才能知道大模型到底有没有提升。
  • 样本量要够:每条文案至少要有几千次曝光,数据才有统计意义。所以测试时不要一次上太多文案,宁可分批测。
  • 指标要明确:不同渠道看不同指标。短信看点击率和转化率,Push看打开率,朋友圈看互动率和转化率。

测试数据回流后,做两件事:一是把跑量好的文案加入案例知识库,作为后续生成的参考;二是分析大模型打分和实际效果的偏差,优化打分维度和权重。这个闭环跑起来之后,文案的点击率大概能提升20-30%,转化率提升10-15%。

4. 常见问题与排查技巧实录

4.1 大模型生成内容"千篇一律"怎么办

这是最常见的问题。表现是生成的文案读起来都差不多,缺乏新意。原因通常有三个:一是prompt里的风格标签太少,大模型没有足够的多样性输入;二是知识库检索出来的内容太相似,导致生成时参考的素材单一;三是打分节点的权重设置过于偏向"安全",把有创意的文案都筛掉了。

解决办法:在prompt里增加"随机种子"机制。具体做法是每次生成时,从风格标签库、案例库、句式模板库里随机抽取组合,让每次生成的输入上下文都不一样。另外,打分节点的"吸引力"权重可以适当调高,给有创意的文案更多机会。

4.2 合规校验误杀率太高怎么调

合规校验太严,会把很多正常文案拦下来,导致可用率下降。我们的经验是分级处理:规则引擎命中的,直接拦截;小模型判断"不合规"的,进人工复核队列,而不是直接丢弃。人工复核时,如果确认是误杀,就把这条case加入小模型的训练数据,迭代几轮之后误杀率会明显下降。

另外,禁用词库要定期review。有些词在特定语境下是合规的,比如"第一"在"第一时间响应"里就没问题,但在"行业第一"里就违规。这种语境相关的判断,规则引擎做不了,要靠小模型或者人工。

4.3 文案效果波动大怎么归因

有时候同一套文案,今天投效果很好,明天投效果就很差。这种波动可能来自几个方面:人群包质量变化、渠道流量质量变化、外部竞争环境变化、文案疲劳。排查的时候,先看人群包和渠道数据有没有异常,如果没有,再看是不是文案疲劳——同一批用户反复看到相似文案,点击率自然会下降。

解决办法是建立文案轮换机制。每个文案设置一个"疲劳阈值",曝光达到一定次数后自动下线,换新的文案。同时,在生成时增加"与历史文案的差异度"作为打分维度,避免生成和已投文案太像的内容。

4.4 常见问题速查表

问题现象可能原因排查方向解决建议
文案可用率低prompt约束太严/知识库不匹配检查prompt禁用词和知识库检索结果放宽非红线约束,优化知识库粒度
合规误杀率高小模型训练数据偏差分析误杀case的共性补充训练数据,调整分类阈值
文案同质化严重风格标签少/案例库单一检查生成时的随机输入扩充风格库和案例库
效果波动大人群/渠道变化/文案疲劳对比历史数据,看曝光频次建立轮换机制,增加差异度打分
生成速度慢同步调用/批次太小检查调用方式和批次大小改异步并发,增大批次
打分不准维度权重不合理对比人工判断和大模型打分调整权重,增加"先写理由"步骤

4.5 几个踩过的坑和实操心得

坑一:知识库更新不及时导致文案"翻车"。有一次货拉拉调整了某城市的计价规则,但知识库没同步,大模型生成的文案里还写着旧价格,投出去之后被用户投诉。后来我们加了一个机制:知识库更新后自动触发一次全量文案的重新校验,把过时的文案标记出来。

坑二:过度依赖大模型打分。早期我们完全按大模型打分排序,结果发现有些打分很高的文案实际效果一般。后来改成"大模型打分+人工抽检+小流量测试"三重验证,才把这个问题解决。

坑三:忽略渠道特性。同一个文案,在短信里效果好,在朋友圈里可能就很差。因为短信是"强触达+短阅读",朋友圈是"弱触达+场景化阅读"。后来我们在prompt里强制要求标注渠道,并且针对每个渠道单独维护了一套文案规范。

心得一:人工审核不能省。不管大模型多强,营销文案最终是要面向真实用户的,人工审核是最后一道防线。我们的做法是审核同学只做"通过/不通过"的快速判断,不做修改,修改交给大模型重新生成,这样效率最高。

心得二:数据回流要自动化。文案效果数据如果靠人工导出、人工分析,迭代速度会非常慢。我们的做法是搭了一个自动化看板,每天自动拉取各渠道数据,自动计算每条文案的点击率、转化率,自动标记"优秀/合格/淘汰",运营同学只需要看标记结果就行。

心得三:prompt要版本管理。prompt改来改去,如果没有版本管理,很容易出现"改坏了不知道改哪了"的情况。我们的做法是把prompt当成代码来管理,每次修改都记录版本号、修改内容、修改原因,方便回溯。

这套东西跑下来,最大的感受是:大模型在营销广告里的价值,不在于它写得多好,而在于它写得够多、够快、够便宜。人工写一条精品文案可能需要半小时,大模型写一条及格文案只需要几秒钟。把大模型用在"规模化生产"上,把人工用在"质量把控"和"策略制定"上,这个分工才是合理的。至于那些追求"大模型写出爆款文案"的想法,我个人的经验是:爆款靠的是对用户的深刻理解,大模型目前还做不到这一点,但它可以帮你把"及格线"以上的文案批量生产出来,让你有更多精力去研究用户。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询