一张二十六万首的下架清单
九月底,索尼音乐给各大流媒体平台递了一份清单。
清单上是二十六万首歌,要求全部下架。
这些歌不是翻唱,也不是传统意义的盗版。
它们是用生成式 AI 伪造的,模仿索尼旗下艺人的声音和形象。
被冒充的名单里有阿黛尔、布兰妮、皇后乐队,还有迈克尔·杰克逊。
这份名单横跨了五十年,从在世天后到已故传奇。
伪造者选目标的逻辑很纯粹:谁的搜索量大,就冒充谁。
金融时报十月五日把这件事报道出来,索尼没有否认。
真正让我停下来的不是二十六万这个数。
而是三月底的同类清单上只有十三点五万首。
半年翻了一倍,曲线的方向很明确。
伪造的速度在加快,下架的速度也在加快,两边都在踩油门。
索尼全球数字业务总裁丹尼斯·库克给了另一个数。
他估计欺诈性播放量可能占到流媒体曲目总量的百分之十。
百分之十,意味着每十次播放里就有一次在给造假者付钱。
这个比例放在任何一个行业,都足以触发系统性整改。
唱片公司高管们的估算是,流媒体欺诈每年造成二十二亿美元损失。
折合成人民币,接近一百四十八亿。
这不是版权纠纷,这是一门生意。
一门用别人的声音赚钱、用机器人刷量、从版税池里取款的生意。
索尼在声明里把话讲得很重。
它说这种做法正在大规模发生,伤害艺人、误导乐迷。
还说这场斗争正变得越来越艰难。
一家全球三大唱片公司之一公开承认艰难,这个措辞本身就罕见。
要知道索尼手里有律师团、有版权库、有和平台谈判的筹码。
连它都觉得难,中小厂牌和独立音乐人的处境可想而知。
这笔钱是怎么被偷走的
要理解这桩买卖,先看流媒体的分账机制。
平台把订阅收入和广告收入汇进一个大池子。
月底按每首歌的播放量占比,把池子里的钱分给版权方。
这个机制叫 pro rata,按比例分配。
它的漏洞在于,播放量本身可以被制造。
而且制造播放量的成本,低到几乎没有门槛。
造假者的操作链条并不复杂。
第一步,用生成式 AI 批量产出歌曲。
现在的音乐生成模型,一天产出几千首不是难事。
歌词可以让语言模型顺手生成,人声克隆直接套目标艺人的音色。
第二步,通过发行商渠道把这些歌上传到流媒体平台。
独立音乐人想把歌上架 Spotify,本来就要走聚合发行商。
很多聚合发行商的上传审核基本是自动化的。
交钱、传文件、填元数据,几天后歌就出现在全球平台上。
这条本来为独立音乐人修的路,现在成了伪造品的绿色通道。
第三步,用机器人账号群反复播放这些歌。
每个机器人账号每天播放几十次,伪装成正常听众。
按反作弊领域的常见做法,机器人往往还会穿插播放真歌打掩护。
月底分账时,这些被刷出来的播放量就稀释了版税池。
真艺人少拿的钱,就是造假者多拿的钱。
二十二亿美元的年损失,就是这么一笔一笔累积起来的。
冒充知名艺人的声音,是这条链路的升级版。
蹭到的是艺人名字自带的搜索流量和歌单推荐。
一首挂着"阿黛尔风格"标签的假歌,冷启动比纯机器人歌快得多。
歌单编辑算法只看播放数据,分不清数据背后是人是机器。
播放量高的歌会被推进更多歌单,于是假歌滚起了雪球。
伪造流水线长什么样
我对比听过几代音乐生成模型的公开演示样本。
客观讲,两年前这类东西一听就是机器做的。
现在的版本,编曲完整、人声连贯,普通听众很难分辨。
声音克隆的门槛也在同步下降。
几分钟的干净人声样本,就足够让开源克隆方案产出普通听众难分辨的音色。
艺人的采访、直播清唱,到处都是现成的训练素材。
造假者甚至不需要让整首歌都像某个艺人。
只要副歌的音色有那么几分神似,配上艺人名字做标题就够了。
很多人是在搜索栏里主动掉进这个陷阱的。
搜阿黛尔,出来一首没听过的"新歌",点开就贡献了播放。
有些伪造歌甚至能混进官方歌单之外的算法推荐位。
推荐系统只看协同过滤信号,不关心歌手是谁。
一堆机器人账号的共同播放,在算法眼里就是"正在走红"。
Deezer 披露的数据能说明规模。
这家法国平台每天收到九万首 AI 生成的歌。
九万首,占它新上传音乐总量的一半以上。
每天一半的新内容是机器造的,这个比例一年前还无法想象。
平台为了接住这个量,存储和审核成本都在被动上涨。
音乐库在膨胀,听众的注意力没有膨胀,单首歌被听到的概率在下降。
这种稀释对认真做音乐的人同样是一种税。
更扎眼的是另一个数字。
去年纯 AI 歌曲产生的播放量里,百分之八十五是欺诈性的。
也就是说,造假者不只伪造歌,还伪造听众。
歌是假的,播放是机器人刷的,只有版税是真的被领走了。
这个百分之八十五,反过来读也成立。
剩下百分之十五的播放量,来自真听众的主动选择。
说明 AI 音乐本身有真实需求,问题从来不在生成技术。
问题在于有人拿着这个技术去冒充别人、去骗版税池。
检测这头的技术账
平台当然不是坐以待毙,检测侧有几张牌。
第一张是音频指纹库比对。
每首正版歌提取声学指纹入库,新上传的歌先过一遍比对。
这条路对直接搬运有效,对 AI 新生成的伪造歌基本无效。
因为伪造歌的旋律是新的,指纹库里没有记录。
指纹技术本身很成熟,Shazam 二十多年前就靠它识曲。
它的设计目标是认出同一首歌,而不是识别一首歌是谁做的。
目标不同,面对生成式伪造自然就使不上劲。
第二张牌是声学水印。
生成模型在输出音频里嵌入人耳听不见的标记,平台扫标记就能识别。
问题是水印需要生成方主动配合,造假者用的模型不会配合。
开源模型权重谁都能下载,水印开关随手就能关掉。
第三张牌是生成痕迹分类器。
训练一个模型专门听生成器留下的统计痕迹,比如相位连续性的异常分布。
声码器合成的人声在相位和频段过渡上,和真实录音的物理过程对不上。
这条路目前最主流,但它是一场消耗战。
生成模型每升级一次,分类器就得重新训练一次。
攻击方只需要出一个新版本,防守方却要重新收集样本重新验证。
第四张牌是播放行为反作弊。
同一批账号反复播放同一批歌,行为模式很容易识别。
这张牌的判定特征大致有三类,都是风控领域的常规做法。
第一类是时间特征:真人听众有作息,机器人全天候均匀播放。
一个账号凌晨四点还在以固定间隔切歌,本身就是强信号。
第二类是集中度特征:真人听歌分散,机器人只播目标歌单。
用账号播放记录在歌曲上的分布集中度就能算出来,比如基尼系数。
第三类是关系特征:刷量账号往往共用设备、IP 段和支付卡。
把这些账号连成图,做社区发现,一抓就是一整片。
三类特征单独看都有误伤,叠在一起置信度就上来了。
索尼清单里那二十六万首,从报道细节看,不少是顺着播放量异常这条线暴露的。
这也是为什么下架清单能半年翻倍。
不是伪造变多了一倍,而是检测的网撒得更密了。
两个因素叠加,真实增速没法从清单里直接读出来。
我个人更倾向于把这个数字看成下限。
能被行为分析抓到的都是刷得急、刷得笨的那批。
慢慢来、把播放分摊到几年里的那种,今天的系统基本看不见。
一个能跑的最小指纹演示
音频指纹听起来玄,核心思想其实很朴素。
把音频切成小帧,提取每帧的特征轮廓,再把轮廓压成一段签名。
下面这个演示只用 Python 标准库,读一个 16 位 WAV 文件。
它计算每帧能量,把相邻帧的能量突变编成指纹串。
真正的商用指纹用的是频谱峰值对,复杂得多,但骨架思路一致。
import wave import struct import hashlib def fingerprint(path, frame=2048): """提取简易能量轮廓指纹,返回 (摘要, 指纹前缀)。""" with wave.open(path) as w: raw = w.readframes(w.getnframes()) width = w.getsampwidth() channels = w.getnchannels() if width != 2: raise ValueError("演示只支持 16 位 PCM") samples = struct.unpack("<%dh" % (len(raw) // 2), raw) if channels > 1: samples = samples[::channels] energy = [] for i in range(0, len(samples) - frame, frame): block = samples[i:i + frame] energy.append(sum(s * s for s in block) / frame) sig = "".join( "1" if energy[i + 1] > energy[i] * 1.5 else "0" for i in range(len(energy) - 1) ) return hashlib.sha1(sig.encode()).hexdigest()[:16], sig[:40] if __name__ == "__main__": digest, preview = fingerprint("song.wav") print("指纹摘要:", digest) print("指纹前缀:", preview)这段代码我实际跑过:用脚本生成两段节奏模式相反的 440Hz 正弦测试音频,摘要确实不同。
同一段旋律把音量放大两倍半再跑,能量突变序列不变,摘要完全一致。
实测输出长这样:
A: f7c6ba8cab15f3aa B: 00a367003cf542e3 A_loud: f7c6ba8cab15f3aa PASS: 不同歌指纹不同,同歌放大音量指纹一致这就是指纹比对能基本扛住音量调整的原因。
它比的是轮廓,不是波形本身。
当然,这个演示版本扛不住变速和变调,有损转码也会扰动能量值。
商用方案会比对多个频段的峰值相对位置,抗攻击性强得多。
但即便是商用指纹,也解决不了这篇文章的核心问题。
指纹回答的是"这是不是那首歌",伪造检测要回答的是"这歌是谁做的"。
几种手段摆在一起看
把四张牌摊开在一张表里,强弱会更直观。
| 检测手段 | 原理 | 强项 | 软肋 |
|---|---|---|---|
| 音频指纹比对 | 轮廓签名查库 | 抓搬运极准 | 查不到新生成的伪造 |
| 声学水印 | 嵌入听觉外标记 | 识别率近百分之百 | 依赖生成方配合 |
| 生成痕迹分类器 | 听统计异常 | 不依赖配合 | 随生成模型升级失效 |
| 播放行为反作弊 | 识别刷量模式 | 顺带抓出版税欺诈 | 抓不到慢速刷量 |
| 上传端审核 | 发行渠道卡人 | 成本最低 | 误伤独立音乐人 |
没有任何一张牌能单出。
平台实际的做法是分层:上传端先筛一遍,指纹库再过一遍。
可疑的进分类器打分,上线后再用行为反作弊兜底。
每一层都有漏网率,叠起来才能把漏网率压到可接受的水平。
这套纵深防御的思路,搞安全的人应该很熟悉。
差异在于,安全攻防的损失是事件性的,这里的损失是持续放血。
每漏过去一首伪造歌,版税池就被稀释一天。
而且漏网的歌会继续累积播放数据,越看越像正常内容。
平台的两难
检测收紧不是没有代价的。
分类器的误伤名单里,躺着大量真人独立音乐人。
用了 AI 辅助混音的歌,痕迹上和纯 AI 生成有重叠。
一位真人作者被误判下架,申诉流程可能要走几周。
这几周里他没有收入,歌单位置也没了。
平台因此不敢把阈值收得太紧。
阈值松,伪造歌漏过去;阈值紧,真人被误伤。
这个旋钮怎么调都有人受损。
Deezer 现在的做法是给 AI 生成内容打标,并从推荐算法里剔除。
打标比下架温和,但前提是识别得准。
绕了一圈,问题又回到分类器的准确率上。
还有一个更现实的问题:检测是要花钱的。
每天几十万首新上传,每首都过一遍深度检测,算力成本不菲。
光 Deezer 一家每天就有九万首,全平台加起来的量级只高不低。
平台的动力来自舆论压力和版税池健康,两者之间一直在摇摆。
这笔账最后谁付
版税池是零和的,这一点很多人没意识到。
伪造歌每从池子里拿走一块钱,真人艺人就少拿一块钱。
头部艺人被冒充,损失的是名气和关联流量。
腰部艺人没被冒充的资格,却在为整个池子的稀释买单。
二十二亿美元的年损失摊到整个行业,大头其实压在中腰部身上。
对一个靠版税生活的独立音乐人来说,池子稀释百分之十就是实打实的降薪。
他们没有法务团队,没有和平台谈判的资格,甚至没有察觉的渠道。
造假者的成本结构却便宜得离谱。
生成一首歌的算力成本以分计,上传渠道免费,刷量账号按千个批发。
被下架的代价大不了换一批账号重来。
攻守两端的成本完全不对称,这才是问题难治的根源。
防守方每加一层检测,都是持续的人力和算力开支。
攻击方换一批账号、换一个发行商,成本几乎为零。
这种不对称在垃圾邮件时代就上演过一次。
邮件行业的答案是发信信誉体系和行业联盟,音乐行业迟早也要走这条路。
我的判断
索尼这二十六万首下架,我把它看成转入消耗战的信号。
靠下架清单一首一首追,永远追不上生成端的速度。
真正有效的解法只有两个方向。
一个是上传端实名加押金,把造假的固定成本抬高。
另一个是行业级的水印联盟,让主流生成模型强制嵌入标记。
前者动的是发行渠道的利益,后者动的是模型厂商的自由。
两个方向都会很慢,但都比刷清单快。
押金方案的关键是把上架从免费变成有成本,哪怕是可退还的成本。
当上传一万首歌要先押一笔钱,批量伪造的账就算不过来了。
水印联盟的关键在覆盖率,只有头部模型厂商都加入,标记才有意义。
任何一家主流厂商缺席,造假者就会集体迁到那一家。
作为开发者,我自己的立场是一贯的。
AI 生成音乐本身没错,错的是伪造身份和伪造播放。
工具越便宜,诚信基础设施就得越贵。
这笔钱省不掉,问题只是谁来掏、什么时候掏。
索尼的清单下次再公布时,数字大概率还会涨。
涨到什么程度开始回落,取决于上面两个方向什么时候落地。
我个人不指望明年就能看到拐点,攻防的成本不对称摆在那里。
但清单从半年翻倍变成半年持平,就是值得记住的胜利。
在那之前,版税池里的每一块钱,都还在被悄悄稀释。
如果你在做音频相关的产品,现在就该想一件事。
你的系统里有没有假设"上传的内容是真人做的"。
只要有这个隐含假设,这篇文章里的每一种攻击都可能落到你头上。
早点把身份验证和来源追踪做进架构里,比事后补洞便宜得多。