选秀类综艺最近确实卷土重来,只是舞台中央的主角已经和之前不太一样了。这回来的很多选手都不是真人:虚拟偶像、AI歌手、数字人,甚至某些连固定外形都没有的语音角色,都可能出现在竞演名单里。
所谓“非真人选手”,并不是一个统一的物种。它们的形象可能是3D模型、2D立绘、写实数字人脸;声音可能是真人声库、AI合成、或者两者混合;在节目里的一举一动,背后可能是真人在实时驱动,也可能是一套自动决策系统在接管。这篇不打算讨论娱乐八卦,而是想从技术从业者的视角拆几个问题:这些虚拟选手到底是怎么被做出来的?一个团队想做一只能够参赛的虚拟选手,需要准备什么?观众要怎么分辨它到底是“真智能”还是“编排好的表演”?以及最容易翻车的地方到底在哪。
先把结论放在前面:现阶段大多数“非真人选手”并不是完全自主的AI,而是“形象、声音、驱动、内容”四层能力的综合产品。能走到台前,靠的是建模、动捕、语音合成、实时渲染和内容团队的深度配合。任何一层出问题,在镜头前都会被放大。
1. 先分清:选秀舞台上的“非真人”到底有哪几种
如果只说“虚拟选手”,很容易把问题想简单。实际上,当前能被塞进选秀舞台的角色,至少可以分成四种形态。它们的技术路线完全不同,制作成本和使用场景也不一样。
1.1 虚拟偶像型选手
这类角色通常有一个完整的人设、外形、世界观,会用3D模型或者高精度2D立绘出现在舞台上,最典型的技术特征是有固定形象和对应声库。
虚拟偶像的核心是“有形象的声库”,声音来自真人歌手的音源或经过训练的合成音色,形象和声线之间是强绑定的。歌唱类内容表现稳定,但临场对话能力通常比较弱,语言内容更多来自提前录好的语料和脚本。如果节目里有一段和评委的互动,这类选手往往需要背后有人实时选句配音,或者直接播放预设语音。
1.2 AI歌手型选手
AI歌手型选手更强调“声音的生成能力”,可以没有完整身体,甚至可以没有固定形象。它们通常基于歌声合成模型,把歌词、旋律、情绪标记输进去,就能生成接近真人的演唱。
这类选手的优势是内容生产速度快、音域宽广、情绪可以反复调整。同一首歌可以用同一个音色翻唱,也可以临时换风格。缺点是舞台表现力靠音乐本身支撑,一旦需要即兴问答、现场互动,就会暴露出“没有完整智能体”的问题。
如果节目里出现一个只有立绘、没有完整肢体动作,但歌声稳定、音准极好的选手,大概率属于这个类型。
1.3 智能数字人型选手
数字人型选手是目前最接近“准真人选手”的形态。它们通常具备实时对话能力、面部表情、肢体动作和上下文记忆,背后往往接入了大语言模型、语音识别、语音合成和视觉驱动系统。
这类角色可以完成比较自然的现场互动:听清楚评委提问,经过延迟后组织语言,用相对稳定的情绪状态回应,甚至围绕自己的“人设”给出带立场的内容。
不过要注意,数字人的“智能表现”高度依赖背后的模型和规则设计,不能把它等同于全知全能。遇到知识盲区、突发话题、反问陷阱,它的反应可能会突然变得生硬,甚至答非所问。
1.4 混合驱动型选手
现实节目里我见得比较多的反而是混合驱动型:一个看起来像AI的角色,背后可能是一套“中之人动捕+AI变声+脚本引导”的组合。
中之人即幕后真人演员,负责动作、表情、语气起伏;AI负责把声音进行变身处理,让观众听到的不是演员本人声音;再叠加一套知识库或提示词脚本,让角色的即兴回答尽量不偏离人设。
这种方案最稳定,也最“出效果”,但严格来说它不是纯AI选手,更准确的说法是“真人驱动的虚拟角色”。对观众来说,能感受到角色有鲜活感;对技术团队来说,难点在于真人和虚拟角色之间的同步,以及长时间保持状态不穿帮。
这四类形态并不互斥,很多节目选手会同时使用其中两三种。分清它们,是后面讨论制作流程和判断标准的前提。
| 类型 | 形象 | 声音 | 临场表现 | 制作重点 |
|---|---|---|---|---|
| 虚拟偶像型 | 固定3D/2D形象 | 声库/真声音源 | 依赖脚本与预设,互动较弱 | 形象绑定与声音一致性 |
| AI歌手型 | 可有可无,以立绘为主 | 歌声合成模型 | 演唱稳定,即兴对话弱 | 歌声自然度和情感参数 |
| 智能数字人型 | 完整数字人形象 | 情感语音合成 | 可实时对话,依赖模型能力 | 知识库、延迟与表情协作 |
| 混合驱动型 | 完整虚拟角色 | 真人配音+AI变声或混合 | 互动自然,靠幕后真人接管 | 同步性、接管流程与人设管理 |
2. 虚拟选手能站上竞演舞台,靠的不是单点技术而是这条完整管线
很多刚开始关注这个方向的人,会以为做一个虚拟选手就是“建个模型,接个语音合成”。真正跑过之后就会发现,能站上舞台的角色,背后几乎都是一条完整的内容生产管线。我通常把它拆成四层。
2.1 形象层:从建模、绑定到实时渲染
形象层解决的是“观众看到什么”的问题。角色从原画设定开始,经过建模、贴图、材质、骨骼绑定、表情混合等环节,最终进入实时渲染引擎。
这一层最容易忽略的是绑定权重。模型外观再精致,如果骨骼权重分配不合理,抬手、转身、坐姿都可能出现穿模或扭曲,镜头一旦推近就会非常明显。另一个常见问题是表情集合没有覆盖常见情绪,导致情绪表达只有嘴巴动,眉毛和眼神完全不变。
判断形象层是否合格,不能只看静态截图。要放到节目环境里做多机位测试:远景看身材比例,近景看皮肤材质和眼神,侧机位看肢体动作是否自然。录播可以后期修,直播就只能靠实时渲染的稳定性了。
2.2 声音层:歌声合成与情感语音
声音层决定观众听到什么。歌唱类内容需要使用歌声合成引擎,把乐谱、歌词和情绪参数转换成带呼吸感、带咬字细节的演唱。对白类内容则需要情感语音合成,让同一句话在不同语境下有不同的重音和节奏。
这里有一个容易被低估的问题:声音的一致性。节目录到一半,如果声库版本更新或者推理参数变了,观众会立刻察觉“声音好像和上一期不一样”。因此,从立项开始就要把音色版本、混音处理链、响度标准和基准参数固定下来,所有彩排、正式录制、宣传内容使用同一套声音配置。
声音层还需要考虑口型同步。口型不是简单开启一个自动对嘴功能,而是要结合语言音素、情绪、语速做映射。测试口型是否合格,最直接的方法是播一段对话,盯着嘴部动作看会不会出现“句子都说了三四个字,嘴巴才开始动”的滞后感。
2.3 驱动层:中之人、动捕与智能体决策
驱动层是让角色“动起来、有反应”的核心。如果采用真人在线驱动,需要动作捕捉设备、表情捕捉设备和一套低延迟的映射系统。动作捕捉设备按精度可以大致分为视觉方案和惯性方案:视觉方案需要特定摄像头阵列,精度较高;惯性方案佩戴更方便,但长时间使用会出现累积漂移,需要不断校准。
如果角色是智能驱动,就要接入语音识别、大语言模型、情绪识别和回复规则系统。这里最关键的是超时控制。评委问完一句话,如果角色超过几秒没有回应,现场气氛就会冷掉。经验做法是给语音识别、知识检索、大模型推理和语音合成每个环节设单独的超时阈值,并把所有阻塞路径汇总成一条兜底话术。
大多数节目并不会完全依赖智能驱动,因为不可控因素太多。更常见的做法是智能推荐候选回复,由幕后人员快速确认或者接管。这个“人机协同”的接管链路,往往比模型本身更重要。
2.4 现场层:导播、灯光、互动数据与多路推流
最后一层是舞台现场相关的能力。虚拟选手需要被实时合成到舞台画面里,所以必须有稳定的渲染推流,支持多机位导播切换,同时兼顾灯光变化和观众互动数据。
实时渲染对硬件的要求比较直接:显存不足会导致卡顿,CPU占用过高会影响动作捕捉数据处理,网络带宽不够会造成推流掉帧。节目组一般会准备专门的渲染机器和推流机器,避免把渲染和录制任务放在同一台设备上。彩排时要特别盯两个数据:渲染帧率和推流帧率,理想情况下应该接近节目输出的帧率标准,如果出现明显下降,首先要查渲染负载而不是网络带宽。
现场层还包括弹幕和投票系统。后台会根据观众互动改变舞台特效或选手状态,这需要互动数据与角色驱动系统打通。互动量瞬间过大时,数据链路要能扛住并发,否则会出现舞台特效滞后甚至录制中断。
3. 如果团队想亲手做一个虚拟选手,按这个顺序落地
我自己做过不少虚拟形象和语音相关的实验,发现最容易出的问题不是预算不足,而是流程顺序搞反。很多人一上来就买动捕设备、租渲染服务器,结果角色设计反反复复改,前面所有投入白搭。更稳妥的做法是先跑通最小闭环,再逐步扩大。
3.1 先定竞演场景
做虚拟选手之前,先明确它要出现在什么场景里:
- 如果是MV型内容,可以先不考虑实时交互,重点放在模型、动画、口型、歌声合成和视频渲染。
- 如果是直播互动型内容,要多花时间在驱动链路、延迟、智能问答和粉丝互动上。
- 如果是综艺现场型内容,则要提前考虑多机位、导播切换、幕后接管和长时间稳定性。
场景决定技术路线。不要一上来就要求“所有能力都要有”,那样会把系统做得非常复杂,最后哪一层都很难达标。
3.2 低成本最小闭环
无论预算多少,我建议第一个里程碑只做一件最简单的任务:通过一条30秒视频验证“角色形象、语音合成、口型同步、视频导出”这条链路。
可以按这个顺序准备:
- 选择一个现成3D模型或使用免费建模工具制作角色,不需要高精细度,但骨骼绑定要完整。
- 准备一段中文文本,使用语音合成工具生成语音,导出为音频。
- 把音频导入到实时渲染或动画软件里,通过口型同步能力生成嘴部动作。
- 给角色安排一个简单拍摄机位,录制视频并导出,检查声音与画面是否同步、语气是否自然。
这一步不需要写复杂的代码。重点是让团队建立“从文本到成片”的完整认知。如果这个30秒闭环都跑不通,后面加再高级的动捕和AI能力都会非常痛苦。
注意:先跑通最小闭环,不是为了展示功能,而是为了把不确定因素一个个消掉。越早暴露问题,后面越省成本。
3.3 进阶:动捕、表情捕捉和人设数据库
30秒闭环跑通后,再往里面增加实时驱动能力。
动捕可以从小设备开始。先试单相机/单摄像头的视觉动捕,观察手部、腿部动作是否自然,再根据需求决定要不要买专业动捕服。通常一套普通的面部捕捉就足够驱动表情,肢体动作可以用一键动画库临时覆盖,不一定非要上全身动捕。
智能交互类角色要从人设数据库开始做。把角色的背景故事、口头禅、立场、禁忌话题、常用回复模板整理成结构化文本,导入到知识库或提示词系统里。这一步做不好,角色很容易出现人设漂移:上期还很自信,下期就突然变得唯唯诺诺,粉丝很快会发现不对劲。
3.4 节目级配合:彩排、紧急接管和内容审核
一旦角色要进入正式节目,就不再是单纯的技术问题了。需要建立一整套配合机制:
- 彩排机制:针对竞演曲目、评委提问、突发互动做至少几轮彩排,把常见问题提前暴露。
- 紧急接管机制:智能系统出现偏差时,由幕后人类快速接管形象和语音。
- 审核机制:所有对外展示的台词、歌曲、互动内容都要经过审核,避免出现不适合传播的内容。
- 日志机制:记录每一次交互的输入、输出、延迟、资源占用和人工干预节点,既能做复盘,也能作为后续优化依据。
这些环节没有多少技术含量,但决定了项目能不能从Demo走向正式舞台。
4. 如何分辨舞台上的选手是真AI还是编排好的表演
作为普通观众,经常会有个疑问:这个看起来反应很快的虚拟选手,到底是聪明的AI,还是背后有人在配音?这个问题没有绝对答案,但有一些观察方法。
4.1 看临场反应的窗口期
真人驱动的角色,遇到意外问题时反应通常会非常快,因为中之人可以直接说话并通过变声系统输出。纯AI驱动则会出现一个可感知的延迟,通常在1到3秒之间,取决于语音识别、大模型推理和语音合成的总耗时。
如果选手面对评委的每次提问都能在极短时间内做出有逻辑的回答,那么大概率背后有真人判断;如果回答偶尔明显停顿,但停顿后内容质量很高,可能是AI生成了候选再由真人挑选确认。
4.2 看声画同步和微表情
真人驱动时,表情和语音的同步感通常比较好,因为声音和面部捕捉来自同一个人。纯AI驱动时,容易出现表情滞后、眼神方向与说话对象不一致、语句情绪和表情不匹配的问题。
让观众最容易感知到“假”的,往往不是声音本身,而是表情。如果角色在说一句悲伤的话时,嘴角还挂着程式化微笑,这种违和感比音色失真还要明显。
4.3 看互动数据有没有专用通道
综艺节目里如果虚拟选手能单独领取任务、接受观众点歌、和评委连线互动,说明它有专门的产品设计。这种互动内容通常是提前设计好的,不一定代表AI能力。
要判断是“真智能”还是“编排”,最简单的测试是连续追问。多看完整节目,而不是只看剪辑后的高光片段。剪辑会把漫长的延迟、失误和低级回答全部去掉,留下的自然每个都像“高智商AI”。
4.4 多数节目是“人机协同”,不必迷信全自动
我个人的判断是,现阶段能让节目稳定播出的虚拟选手,绝大多数都是人机协同,也就是AI生成内容、真人负责决策和控制节奏。全自动AI选手当然有,但更适合短视频、广播、自动问答这类能容忍延迟和出错的场景。
对从业者来说,不必纠结“这个选手是不是100%AI”,更值得关注的是它的产品体验是否一致:形象是否稳定、声音是否有辨识度、互动是否让人舒服、出现失误时有没有兜底。观众买的不是技术纯度,而是观看体验。
5. 最容易翻车的三个环节:动作、声音、人设
虚拟选手翻车的原因,通常在三个环节。很多问题一开始看像技术故障,深入排查之后会发现是流程问题或资产问题。
5.1 动作问题:穿模、抖动、肢体不自然
动作穿模是最直观的翻车现场。手穿过身体、衣服嵌入腿部、坐姿时模型塌陷,这些问题大多来自骨骼绑定和权重资产本身,不一定是实时渲染引擎的问题。
解决办法是前期多做静态测试:给角色摆出各种极端动作,检查是否有穿透,而不是等舞台演出时才发现。如果出现肢体抖动,优先检查动捕数据滤波参数和设备校准情况,不要急着换渲染器。
5.2 声音问题:AI味、长句断句、情感断层
语音合成最容易出问题的不是短句,而是长句。长句一旦超过模型训练时的合理长度,就可能出现断句错误、重音偏移、语速失控。一个简单的验证方法:找一段超过200字的中文独白,分别用短句和长句生成,对比听感。
如果“AI味”很重,通常需要做三件事:选用更合适的情感语音合成方案,在合成前对文本做韵律标注,或者在生成后交给语音后期统一做修音处理。不要指望只换一个声音模型就能彻底解决问题。
5.3 人设问题:前后矛盾、常识缺失、突发失语
人设前后矛盾是智能交互类角色的致命伤。上期说自己喜欢喝咖啡,下期又说从来没喝过,观众会立刻出戏。这背后往往是知识库和角色设定没有统一管理。
解决思路是建立一份角色设定文档,所有接入的系统统一读取。不管是大模型提示词、语音合成参数,还是后期剪辑字幕,都围绕同一份文档执行。遇到紧急提问,优先从设定文档里找答案,而不是让模型自由发挥。
5.4 一套通用排查顺序
我踩过的很多坑,最后都收敛到一条排查路径:
- 先看现象:是卡顿、穿模、没有反应,还是反应质量差?
- 再看输入:文本、音频、动捕信号是否完整,有没有格式问题?
- 再看环境:当前机器的CPU、GPU、内存、磁盘占用是否正常?
- 再看参数:模型路径、端口、阈值、并发数、语音引擎版本是否和预期一致?
- 最后再看代码和系统配置:是否是版本更新导致行为变化?
这条路径对大多数虚拟角色系统都适用。不要一上来就改模型参数,很多时候问题出在输入文件、机器负载或者路径配置上。
排查问题最忌讳的是上来就调参数。先确认输入、环境和版本,再考虑模型行为。
6. 边界感:虚拟选手不是技术越强就越能留下观众
聊到这里,想认真给准备进入这个方向的团队一些边界性的提醒。
6.1 虚拟选手不能替代“真人感”
观众投票给虚拟选手,很多时候并不是认可它技术有多强,而是喜欢这个角色带来的“拟人感”。如果团队把精力全放在技术指标上,忽视了角色个性、故事线和情绪表达,技术再厉害也留不住粉丝。
真正的难点在于:让虚拟选手看起来不是“会唱歌的机器人”,而是“有性格、有记忆、有成长弧光的存在”。这需要编剧、美术、技术、运营共同参与,不是技术团队单独能完成的。
6.2 成本控制的重点
虚拟选手的成本不只是建模和渲染。长期运营成本中占比最高的是内容制作、声库维护、驱动团队人力和节目彩排时间。很多项目外表光鲜,实际上每次彩排都需要十几个人协作,这个成本很容易被低估。
如果预算有限,建议先集中优势兵力把一件事做到极致:要么把歌声表现做到足够专业,要么把互动体验做到高度自然,不要全链路平均用力。等验证了用户确实买账,再逐步扩建管线。
6.3 最后几条现实建议
- 从30秒最小闭环开始验证,不要直接做一整档节目。
- 正式接入节目之前,固定声库版本、模型版本、渲染版本,避免中途变更导致前后不一致。
- 建立人工接管机制,任何自动系统都要有可关闭的后门。
- 每一轮彩排都要记录资源占用和错误日志,提前设置性能红线。
- 多留时间做多机位测试,虚拟角色在导播画面里的问题远比单机位多。
- 不要把技术预算花在追求“全自动无人参与”上,先把“人机协同”做顺更现实。
这轮选秀重新回到大众视野,虚拟选手确实带来了很多新鲜感。但技术圈的人更应该看明白:虚拟选手不是单点算法的胜利,而是一场持续的系统工程。谁能把形象、声音、驱动和内容管线稳定地捏合在一起,谁才有可能真正走到聚光灯下,并且站得久一点。