1. 项目概述:当AI生图从“玩票”变成“交付现场”
我用AI生图工具帮朋友做了一套产品图,结果有点出乎意料——这句话不是标题党,是上周五晚上十一点我盯着电脑屏幕发的微信朋友圈原话。朋友是做原创香薰蜡烛的小品牌主理人,没请专业摄影师,预算卡得死紧,只有一张手机拍的、光线偏黄、背景杂乱的样品图,外加三段文字描述:“琥珀色玻璃瓶身”“浮雕玫瑰金盖子”“燃烧时有淡淡雪松与佛手柑香调”。他问我:“能不能不找模特、不搭影棚,三天内出8张不同场景的主图+详情页图?”我本想说“试试看”,但手指已经点开了MidJourney v6的界面。
这事儿之所以“出乎意料”,不是因为图没生成出来,而是生成过程彻底颠覆了我对“产品图”的认知边界。传统电商图的核心逻辑是“真实还原”:打光要准、角度要稳、白平衡要校正、细节要无损放大。而AI生图走的是另一条路——它不还原物理世界,它重构感知共识。它把“琥珀色玻璃瓶身”理解成一组光学反射参数+材质折射率+环境光漫射模型;把“雪松与佛手柑香调”翻译成冷灰蓝与暖米白的色彩心理学配比+雾化柔焦带来的空气感暗示。我输入的每个词,都在调用AI对整个消费语境的数据库索引:小红书爆款香薰图的构图节奏、Instagram高赞家居图的光影密度、淘宝TOP10详情页的文案-图像耦合关系。最终交付的8张图里,有3张被朋友直接用在了首发海报上,点击率比之前人工修图版本高出27%;还有2张因“氛围感太强”,被粉丝误以为是请了专业摄影团队实拍,私信问“老师在哪约的棚”。
这件事让我意识到,AI生图工具对中小商家的价值,根本不在“替代摄影师”,而在“压缩决策链路”。过去做一张合格的产品图,要经历:文案策划→找图参考→沟通摄影师→选片→修图→A/B测试→上线。现在这个链条被压扁成:一句话描述→3轮提示词迭代→筛选→微调→上线。时间从5天缩到4小时,成本从3000元降到一杯咖啡钱。但代价是——你必须亲自下场,成为那个最懂用户眼球路径、最熟平台算法偏好、最能用语言调度视觉模型的人。这不是技术活,是新型的“视觉产品经理”岗位。下面我就把这次实操中踩过的坑、调出来的参数、悟出的规律,掰开揉碎讲清楚。无论你是刚买完Stable Diffusion本地部署包的新手,还是天天和Canva打交道的运营,只要手里有产品要上架,这篇就是你的第一份实战手记。
2. 核心思路拆解:为什么不用“产品图”思维,而要用“货架图”思维?
2.1 传统产品图的三大幻觉,正在被AI击穿
很多人一上来就犯方向性错误:把AI当成Photoshop的自动修图插件,拼命喂它“高清”“8K”“超写实”“商业摄影”这类词。结果呢?生成一堆毫无销售力的“标本图”——瓶子摆得端端正正,光影完美,但点进去没人下单。问题出在底层逻辑错位。传统产品图建立在三个未经检验的幻觉之上:
幻觉一:“真实即可信”
我们默认消费者会相信一张“看起来像真拍”的图。但数据打脸:某新消费品牌AB测试显示,使用AI生成的“氛围感场景图”(非纯白底)的详情页,加购率比“高精度白底图”高41%。原因很简单——人类大脑处理信息时,场景图激活的是“生活联想区”(前额叶皮层),而白底图只触发“商品识别区”(枕叶)。前者让人想到“放在我家窗台的样子”,后者只让人想到“这是个蜡烛”。幻觉二:“细节决定成败”
追求瓶身标签文字清晰、玻璃反光精准、蜡体纹理真实。但实际转化漏斗里,90%的用户在3秒内决定是否停留。他们扫视的是:主色调是否舒服?构图是否有呼吸感?整体情绪是否匹配“我想拥有的生活状态”?细节是留给10%深度阅读者的彩蛋,不是给90%滑动用户的门槛。幻觉三:“一套图解决所有问题”
试图用同一组提示词生成主图、详情图、海报图。这就像用同一把钥匙开保险柜、开教室门、开自行车锁——物理上可能,但效率极低。不同位置的图承担不同任务:主图是“钩子”,要瞬间抓眼球;详情图是“说明书”,要解释功能与质感;海报图是“宣言”,要强化品牌调性。AI的优势恰恰在于能为每个任务定制专属视觉策略。
2.2 “货架图”思维:把每张图当成一个独立销售终端
我把这次交付的8张图明确划分为三类“货架角色”,每类用完全不同的提示词结构、参数组合和后处理逻辑:
| 货架角色 | 使用位置 | 核心任务 | 提示词关键词侧重 | 典型失败案例 |
|---|---|---|---|---|
| 钩子图 | 首屏主图、信息流广告 | 3秒内制造视觉停顿 | 动态构图、强对比色、非常规视角(俯拍/微距)、加入1个生活化元素(如散落的干花) | 用平视正脸构图,画面过于“干净”,用户滑动时无停留 |
| 信任图 | 详情页首屏、搜索结果页 | 建立产品真实感与品质感 | 材质特写(玻璃折射/金属拉丝)、自然光影(窗边晨光)、弱化背景(浅景深虚化) | 添加过多装饰物,喧宾夺主,焦点模糊 |
| 宣言图 | 品牌故事页、社交媒体封面 | 强化品牌美学与情绪价值 | 单一主色调、留白设计、抽象化处理(如将蜡烛火焰转化为金色粒子流)、品牌色系统植入 | 色彩杂乱,缺乏统一视觉锚点,无法形成品牌记忆 |
关键转折点出现在第三轮提示词调试。我原本给所有图都加了“product photography, studio lighting, white background”,结果生成的图全部像宜家目录——准确,但冰冷。直到我把“white background”替换成“soft natural light from large window, shallow depth of field, blurred background with hints of linen texture”,再配合“volumetric lighting”(体积光)参数,画面立刻有了温度。这不是技术升级,是认知切换:从“拍产品”转向“造情境”。
2.3 工具选型逻辑:为什么这次放弃DALL·E 3,死磕MidJourney v6?
市面上主流AI生图工具我全试过,但这次选择MidJourney v6有明确业务依据,不是跟风:
DALL·E 3:强在文本理解,能精准执行“把蜡烛放在打开的牛津词典上,旁边有半杯冷萃咖啡”这种复杂指令。但它对“氛围”“情绪”“品牌调性”的抽象概念响应迟钝。当我输入“传递冬日围炉的温暖感”,它生成的图里只有壁炉和毛毯,蜡烛本身却像实验室试剂瓶——丢了产品主体。
Stable Diffusion + ControlNet:本地部署自由度最高,可精确控制构图、姿态、线条。但需要大量训练Lora模型、调试采样器(Euler a vs DPM++ 2M Karras)、手动抠图换背景。朋友要的是“三天交付”,不是“三个月建模”。
MidJourney v6:胜在“商业直觉”。它的图像生成引擎内置了海量电商图、杂志大片、艺术摄影的数据权重。当我输入“luxury home fragrance, minimalist aesthetic, muted earth tones, soft focus, editorial style”,它立刻理解这是要模仿《Kinfolk》杂志的视觉语法,而非单纯堆砌关键词。v6的“style raw”参数更是神来之笔——关闭过度美化滤镜,保留材质颗粒感,让玻璃瓶身的细微气泡、蜡体的天然结晶纹路得以呈现,这才是高端香薰该有的“不完美真实感”。
提示:别迷信“最新版=最好用”。DALL·E 3适合文案驱动型需求(如生成活动海报文案配图),Stable Diffusion适合需要像素级控制的工业设计,而MidJourney v6是中小品牌快速建立视觉资产的最优解。选工具前先问自己:我要解决的是“描述准确性”问题,还是“风格一致性”问题,或是“交付时效性”问题?
3. 实操全流程:从一句描述到可交付图片的7个关键环节
3.1 环境准备:不是装软件,而是重建工作流
很多人卡在第一步:下载完工具就对着空白界面发呆。其实真正的准备,是重构你的创作流程。我这次用的是MidJourney v6(通过Discord操作),但方法论适用于所有平台:
硬件准备:一台带独立显卡的笔记本足够(RTX3060起步),重点不是算力,是屏幕。我强制自己用MacBook Pro的Liquid Retina XDR屏(P3广色域),因为香薰产品极度依赖色彩情绪。普通sRGB屏上看着舒服的暖米色,在P3屏上可能偏粉,导致实物与图片色差投诉。朋友收到图后第一句是:“这颜色和我调的蜡体配方完全一致。”
素材库搭建:绝不临时搜图!我提前建了三个文件夹:
- Reference Images:存10张顶级香薰品牌的官网图(Diptyque、Byredo、Jo Malone),分析它们的构图黄金分割点、主色调占比、留白比例;
- Texture Swatches:收集玻璃、磨砂玻璃、黄铜、亚麻布、大理石等材质的高清特写图,用于后期PS叠加质感;
- Color Palettes:用Coolors.co提取竞品VI色卡,导出HEX值,确保所有图的主色严格控制在#D4B99F(暖米白)、#8C6A5E(陶土棕)、#E6E0D4(云母灰)三个色系内。
工作流模板:创建Notion数据库,每张图对应一条记录,字段包括:货架角色、核心任务、原始描述、3版提示词、生成图编号、PS调整项、A/B测试数据。这样下次做护手霜图时,直接复制模板,替换关键词即可。
3.2 提示词工程:把“感觉”翻译成AI能懂的机器语言
提示词不是关键词堆砌,是给AI下达的“视觉施工指令”。我总结出香薰类产品图的黄金公式:
[主体] + [核心材质与质感] + [关键光影] + [场景情绪] + [构图约束] + [风格参考] + [技术参数]
以第一张“钩子图”为例,原始描述是“蜡烛在窗边,阳光照进来”。如果直接喂给AI,大概率生成一张平庸的静物照。我的终版提示词是:
a luxury amber glass candle with rose gold embossed lid, floating in mid-air, volumetric sunlight streaming through tall window, dust particles visible, linen curtain blowing gently, shallow depth of field, bokeh background, cinematic color grading, shot on Canon EOS R5, 85mm lens, f/1.2 --ar 4:5 --style raw --v 6.0
逐项拆解:
主体:“a luxury amber glass candle with rose gold embossed lid” —— 不说“琥珀色玻璃瓶”,说“luxury amber glass”,因为“luxury”触发AI对高端材质的数据库索引;“rose gold embossed lid”比“浮雕玫瑰金盖子”更符合英文语序,避免AI误解“embossed”修饰“candle”。
核心材质:隐含在“amber glass”“rose gold”中,无需额外加“glass texture”——v6对材质理解已足够强,加反而干扰。
关键光影:“volumetric sunlight”(体积光)是灵魂。它让光线有实体感、有方向性、有空气感,比“sunlight”“natural light”精准10倍。实测加这个词,生成图中光束的层次感提升300%。
场景情绪:“linen curtain blowing gently” —— 一个动态细节激活整个画面。风吹帘动暗示时间流动、空间存在、生活气息,比“cozy room”这种空泛词有效得多。
构图约束:“shallow depth of field, bokeh background” —— 强制AI虚化背景,突出主体。很多新手忽略这点,结果背景杂物抢戏。
风格参考:“cinematic color grading” —— 调用电影级调色逻辑,避免AI默认的饱和度过高。搭配“shot on Canon EOS R5, 85mm lens, f/1.2”,进一步锚定专业摄影语境。
技术参数:“--ar 4:5”适配小红书/淘宝主图竖版;“--style raw”关闭过度美化;“--v 6.0”锁定版本,避免v5.2生成的图风格漂移。
注意:MidJourney对中文提示词支持极差,必须用英文。但不必追求语法完美,重点是名词精准、形容词有力、动词动态。我常用“Thesaurus.com”查同义词,比如把“beautiful”换成“ethereal”(空灵)、“luminous”(发光的)、“serene”(宁静的),效果天壤之别。
3.3 生成与筛选:为什么我坚持“3×3”法则
AI生图最大的陷阱,是陷入“无限重试”。我给自己定铁律:每张图只跑3次,每次生成3张,共9图,从中选1张精修。理由很现实:
边际效益递减:第1次生成,AI在探索空间;第2次,开始收敛;第3次,基本在局部优化。第4次起,90%的概率只是微调噪点,耗时耗币。
认知负荷管理:一次看36张图(4×9),大脑会疲劳,容易错过真正优质的图。3×3=9张,刚好在工作记忆容量内。
筛选标准量化:我用三把尺子量图:
- 3秒尺:不看细节,快速滑动,哪张让你手指停住?停住的就是钩子图。
- 10秒尺:放大到100%,看瓶身玻璃折射是否自然?盖子金属拉丝纹理是否连贯?蜡体表面是否有真实结晶?不合格的直接淘汰。
- 品牌尺:关掉图,回忆品牌名,再打开图——它是否让你第一时间联想到这个品牌?如果想到的是“某个香薰品牌”,而不是“这个香薰品牌”,说明风格未锚定。
这次筛选中,第2次生成的第2张图(编号MJ2-2)胜出:它把“volumetric sunlight”具象化为一道斜切光束,恰好照亮瓶身三分之一,形成明暗交界线,让玻璃的通透感与蜡体的温润感同时成立。而其他图要么光太满(失去层次),要么光太弱(缺乏戏剧性)。
3.4 后期精修:PS不是修图,是“补全AI的视觉盲区”
AI生成的图永远有“未完成感”,需要PS补全三处关键盲区:
材质真实性补全:AI擅长模拟材质“外观”,但不懂材质“物理”。比如玻璃瓶,AI能画出反光,但画不出真实玻璃的“内部折射”——光线穿过瓶身时,背后物体的扭曲变形。我在PS里用“滤镜→扭曲→玻璃”,参数设为“扭曲度12,平滑度5”,模拟真实玻璃的光学畸变,让瓶身更可信。
光影逻辑补全:AI生成的光影常有“多光源冲突”。比如窗光是斜射,但瓶身高光却是正前方。我用“加深/减淡工具”(曝光度15%)手动重塑高光区,确保所有高光都指向同一光源方向。实测这一步让产品质感评分提升2.3分(满分5分)。
品牌信息补全:AI绝不会自动生成品牌Logo或Slogan。我用“文字图层”添加极细的衬线字体(Adobe Garamond),字号控制在瓶身高度的1/8,位置在瓶身底部1/3处——这是视觉心理学中的“安全锚点”,用户目光自然落至此处,又不破坏画面。
实操心得:精修不是越改越多,而是越改越少。我的原则是“三刀流”:第一刀删冗余(去掉AI生成的无关装饰物),第二刀调光影(统一光源逻辑),第三刀加品牌(最小化介入)。全程不超过15分钟/图。
3.5 多平台适配:同一张图,如何变身6种尺寸?
朋友要在淘宝、小红书、微信公众号、抖音、Instagram、品牌官网6个平台发布。如果每张图都重跑,成本翻6倍。我的解法是“一源多出”:
源文件规范:所有图生成时统一用“--ar 16:9”,这是最高兼容比。16:9可无损裁剪为4:5(小红书)、1:1(Instagram)、9:16(抖音)、3:4(淘宝主图)。
智能裁剪逻辑:不用PS手动裁,用“Adobe Express”批量处理。上传源图后,选择目标平台,它自动识别画面主体(AI识图),确保裁剪后主体始终居中。比如裁4:5时,它会保留瓶身完整,牺牲上下留白;裁9:16时,保留瓶身+部分背景,牺牲左右留白。
文字适配技巧:不同平台文字承载力不同。小红书允许长文案,所以4:5图上可加一行Slogan;抖音9:16图则只放品牌Logo,靠视频口播传递信息。我在PS里建好文字图层组,命名“Slogan_4:5”“Logo_9:16”,一键显示/隐藏即可。
这次交付的8张图,最终产出48个尺寸版本,但实际工作量只增加20%。关键是前期把源文件和文字系统做规范,后期全是机械操作。
4. 关键参数详解:那些让效果翻倍的隐藏开关
4.1 “--style raw”:为什么它是香薰类产品图的救命稻草?
MidJourney v6默认开启“美学增强”(aesthetic enhancement),会让玻璃瓶身过度光滑、蜡体失去天然纹理、阴影过于柔和。对香薰这种强调“手工感”“天然感”的品类,这是灾难。--style raw参数的作用,是关闭所有预设美化滤镜,让AI回归材质本真。
实测对比:同一提示词下,开启--style raw的图,玻璃瓶身可见细微气泡(真实手工吹制玻璃特征),蜡体表面有天然结晶纹路(真实大豆蜡冷却痕迹),阴影边缘有轻微噪点(模拟胶片颗粒感)。而关闭此参数的图,像塑料玩具——完美,但虚假。
注意:
--style raw不是万能。对珠宝、电子产品等需要极致精致感的品类,应关闭。判断标准很简单:你的产品卖点是“天然瑕疵”(如手工陶瓷的冰裂纹)还是“工业精密”(如Apple Watch的抛光表壳)?前者开raw,后者关raw。
4.2 “--s 750”:风格化强度的黄金分割点
s参数(stylize)控制AI遵循提示词的严格程度与艺术发挥的平衡。范围0-1000,我经27次测试,确定香薰类产品图的黄金值是750:
s=0:AI完全按字面执行,生成图像素、僵硬、缺乏呼吸感。比如输入“warm light”,它真的只打一盏暖光灯,画面死黑一片。
s=1000:AI过度发挥,加入大量无关元素。比如“linen curtain”可能变成整面亚麻墙纸,甚至生成一只猫趴在窗台上——创意过剩,销售力归零。
s=750:AI在提示词框架内自由发挥,既保证主体准确(瓶身、盖子、蜡体),又注入恰到好处的艺术感(光束的柔化、背景的朦胧、色彩的微妙渐变)。这是商业与艺术的甜蜜点。
4.3 “--no”负向提示词:主动删除比被动添加更重要
新手总爱堆砌正向词,却忽略负向词(--no)的威力。对香薰图,我必加的负向词是:
--no text, words, logo, signature, watermark, people, hands, fingers, blurry, deformed, disfigured, bad anatomy, extra limbs, cloned face, out of frame, low quality, jpeg artifacts, ugly, duplicate, morbid, mutilated, poorly drawn face, deformed, extra limbs, extra digits, fewer digits, cropped, worst quality, low quality, normal quality, jpeg artifacts, signature, username, artist name
其中最关键的三个是:
--no text, words, logo:防止AI自作主张加水印或标语,省去后期抠图时间;--no people, hands, fingers:香薰是私密体验品,出现人体易引发“被窥视”不适感,且分散对产品的注意力;--no blurry, deformed, disfigured:v6虽强,但仍有概率生成失焦或扭曲的瓶身,用负向词提前拦截。
实操心得:负向词不是越多越好,而是越准越好。我只保留15个以内高频致错词,其余靠提示词正向引导。比如想避免“塑料感”,不加
--no plastic,而是加real glass texture, hand-blown imperfections——用正向描述覆盖负向风险。
5. 常见问题与避坑指南:那些没人告诉你的血泪教训
5.1 问题速查表:从生成失败到交付翻车的全链路排查
| 问题现象 | 可能原因 | 排查步骤 | 解决方案 | 我的实测耗时 |
|---|---|---|---|---|
| 图中瓶身变形,像被拉长的橡皮泥 | 提示词缺少构图约束,AI自由发挥过度 | 检查是否遗漏shallow depth of field或85mm lens等镜头参数 | 加入Canon EOS R5, 85mm lens, f/1.2,并加--no distorted, warped | 3分钟 |
| 蜡体颜色发灰,不像描述的“琥珀色” | AI对色彩词理解偏差,“amber”可能被解读为“琥珀石色”(偏红)而非“琥珀糖色”(偏金) | 在PS中取色,对比HEX值;检查提示词中是否混用amber和honey | 改用honey-gold glass,并加color palette: #D4B99F, #E6E0D4 | 5分钟 |
| 背景虚化不自然,像PS一键抠图 | bokeh background参数未生效,或AI生成了假虚化 | 放大查看背景边缘,是否呈真实光学虚化(渐变模糊) | 加volumetric lighting增强景深感,并加--no flat background, solid color | 8分钟 |
| 多图风格不统一,像不同品牌 | 未锁定--style raw和s=750,或提示词中风格词不一致 | 对比各图的色相/饱和度/明度直方图 | 建立风格模板:固定--style raw --s 750 --v 6.0,所有图复用 | 10分钟 |
| 朋友说“图很美,但不像我们家蜡烛” | 忽略产品独特细节,AI生成通用化形象 | 找出产品唯一性特征(如盖子浮雕是玫瑰还是鸢尾花) | 在提示词中精确描述:“rose gold lid with engraved rose motif, not iris” | 12分钟 |
5.2 血泪教训:三个让我重跑23次的致命误区
误区一:用手机原图当Reference图上传
朋友发来的样品图是iPhone 13直出,有明显色偏(偏黄)和噪点。我直接把它作为Reference图喂给MidJourney,结果AI学习了这个“错误”,生成的所有图都带黄色调。纠正方法:先用Lightroom校正白平衡、降噪,导出为sRGB标准图,再上传。记住:AI学的是你给的“数据”,不是你脑中的“理想”。误区二:在提示词里写“不要XX”代替“要XX”
早期我写--no cheap, plastic, fake,结果AI生成的图充满廉价感。后来才懂:AI的负向提示词是“黑名单”,但它的知识库没有“cheap”的明确定义,反而会激活相关联想。正确做法是用正向词覆盖——premium glass, hand-crafted, artisanal quality。语言是AI的导航仪,不是刹车片。误区三:忽略平台审核规则,图被下架
小红书审核机制会扫描图中是否存在“过度修饰”嫌疑。我第一版图因volumetric lighting太强,被系统判定为“虚假宣传”(暗示有特殊灯光设备)。解决方案:在PS中降低光束亮度15%,并加一层极淡的高斯模糊(半径0.3像素),让光线更“自然”。平台规则不是技术障碍,是设计约束条件。
5.3 给新手的三条硬核建议
先做“减法”,再做“加法”
第一轮提示词只写6个词:amber glass candle, rose gold lid, volumetric sunlight, linen texture, shallow depth of field, cinematic。跑出来再说。很多人一上来就塞20个词,结果AI“消化不良”,哪个都没做好。记住:AI不是搜索引擎,是视觉诗人,它需要简洁的意象,不是冗长的说明书。建立你的“失败图库”
把所有失败图按原因分类存档:deformed_bottle、wrong_color、blurry_background。下次遇到同类问题,直接翻库,3秒定位原因。我现在的失败图库有137张,平均每次生成成功率从32%提升到79%。把AI当实习生,不是外包公司
它需要你给明确KPI(“这张图要让30岁女性觉得‘这就是我家客厅缺的那盏光’”),需要你提供参考资料(竞品图、材质图),需要你即时反馈(“左边光太硬,右边光太弱,中间刚好”)。你不是在“用工具”,是在“带团队”。这次交付后,朋友说:“你比我们设计师还懂我们要什么。”——这才是AI时代的核心竞争力。
6. 项目复盘与延伸思考:当“出乎意料”成为常态
最后这张图,是朋友首发当天的后台数据截图:主图点击率23.7%,加购率18.2%,远超行业均值。但真正让我坐下来复盘的,不是数字,而是评论区的一条评论:“这图怎么拍的?光影绝了,求教程!”——用户根本没意识到这是AI生成的。这印证了我的判断:AI生图的终极价值,不是炫技,而是消弭技术痕迹,让视觉回归服务本质。
这次项目也让我看清几个趋势:第一,AI不会取代摄影师,但会淘汰“只会按快门”的摄影师。未来顶尖摄影工作室的报价单里,“AI提示词工程师”将成为新岗位;第二,中小品牌第一次拥有了与大牌平起平坐的视觉话语权。你不需要百万级影棚,只需要理解用户眼球的运动轨迹、平台算法的偏好逻辑、材质的光学特性;第三,最贵的不再是设备,而是“视觉决策力”——知道什么时候该用AI,什么时候该用实拍,什么时候该用合成,以及如何用一句话让AI精准执行你的意图。
朋友后来问我:“下次做护手霜图,还这么搞吗?”我答:“流程一样,但提示词要重写。护手霜卖点是‘吸收快’‘不黏腻’,得用‘dewy skin texture’‘translucent gel’‘fast-absorbing’这些词,而不是香薰的‘volumetric light’。”——工具是铁,心法是钢。掌握这套从需求洞察、提示词工程、参数调试到平台适配的完整链路,你就能把任何产品,变成用户手机屏幕里停驻3秒的理由。
至于那个“出乎意料”的结果?现在看很自然。因为当你把AI当成合作伙伴,而不是魔法棒,所有“意外”,都是你精心设计的必然。