1. 展台初见:InterDigital在MWC26现场到底“秀”了什么
巴塞罗那会展中心的展馆一直是这样的调性——越大的展台,屏幕越亮,声音越大。但这次我特意绕开那几个堆满跑车和巨幕的企业馆,直接去了位于2号馆侧的InterDigital展区。原因很简单:这家在通信和视频编码领域耕耘了几十年的技术公司,每次出手都踩在标准演进的节点上,而MWC26正好是6G愿景开始落地的关键一届。
现场比我想象中要安静不少。没有花哨的舞台表演,没有扫码送礼的兼职模特,展台上就是几块触控屏、两副AR眼镜、一台用透明外壳裸露内部结构的信号处理设备,以及一群挂着公司工牌、随时准备跟工程师聊技术细节的讲解员。我挤进人堆里听了三轮讲解,又自己上手试了试几套演示系统,整体印象是:InterDigital这次主打的不是单点黑科技,而是一条完整的“从无线接入到终端体验”的成果链。
先说我能明确看到的四大板块。第一块是面向6G的无线AI平台,核心是一套能实时感知频谱环境、自动调整无线参数的在线学习系统;第二块是沉浸式视频传输方案,重点在点云压缩和移动端VR/AR画质优化;第三块是端侧AI加速引擎,专门解决手机、机器人这些资源受限设备上的模型推理问题;第四块则是一系列标准化布局,包括对VVC、点云压缩等关键技术的专利贡献展示。每个板块都有可操作的原型机和实测数据,不是PPT画饼。
这套打法其实符合InterDigital一贯的定位——不做终端、不卖基站,而是把最底层的算法和专利做深做透,再通过标准授权和合作研发渗透到产业链的每一个环节。对来逛展的普通观众来说,它没有消费级产品那么“好看”,但对搞通信、视频、AI落地的从业者而言,这里的信息量反而比不少明星展台更密集。我花了整整一个下午在这里,整理了十几个问题,跟现场工程师聊了不少细节。这篇文章就把其中最核心的技术思路、演示细节和一些同行最关心的落地经验写下来。
2. 六G无线AI:从“网络自动配置”到“频谱态势感知”
2.1 为什么6G一上来就要拥抱AI
我过去写过几次MWC展后的技术总结,但凡提到面向未来的无线网络,绕不开的共识是:6G绝不会只是5G的带宽倍增,它的核心特征是“内生智能”。为什么要内生?因为6G要服务的场景太杂了——低轨卫星通信、工业超低时延专网、无源物联网、车路协同、通感一体,每一个场景对时延、可靠性、功耗的要求都不一样,甚至互相冲突。如果是人工配置参数,一个切片一个策略去调,网络运维团队根本干不过来。
InterDigital现场演示的那套无线AI系统,解决的就是这个矛盾。系统架构并不复杂:边缘侧部署了若干台软件无线电设备,模拟真实基站和终端的收发行为;旁边一台服务器上跑着在线训练框架。它的核心链路就是“信号特征采集—环境状态实时建模—决策策略输出”这三步,全程没有人工参与。现场工程师给我演示了一个极端场景:在没有任何外部告警的情况下,系统通过监测时频资源上的干扰模式变化,自己判断出本地出现了新的强干扰源,随即把工作频率和波束成型权重都做了调整,整个过程大概不到两秒。
这里有一个值得所有做通信AI的人关注的细节:这套系统不是简单地把训练好的模型拿过来做推理,而是持续在线学习。基站每接收一批新数据,模型会实时更新一小步,从而适应环境变化。用工程师的话来说,他们做的是“让网络自己学会在变化的无线环境里生存”,而不是“让网络执行一个预先编好的谱”。
2.2 现场演示背后的三级技术台阶
如果只是想了解“6G网络能用AI做什么”,上面的概念已经足够。但从技术落地角度,我更关心它具体做到了哪一层。InterDigital这十几分钟的演示,其实是把三级递进的技术能力浓缩在了一起。
第一级是频谱感知。无线系统在不修改协议的前提下,利用接收机已有的基带数据、信噪比估计和时频占用信息,训练出一个环境分类器。它不需要额外加硬件,纯粹是软件升级,这套思路在现有5G网络上就可以先跑起来。第二级是预测性调度。常规的调度器是被动的,收到请求才分配资源,而InterDigital演示的调度器会结合历史数据预测未来几百毫秒的业务需求,提前把资源做好预留,从而降低时延和抖动。第三级是波束与功率的联合自优化,这属于所有分级里最难的一步,因为它直接改变物理层参数,必须保证控制回路收敛,不能出现参数来回震荡的情况。
展台上其实摆着一台实时频谱仪,屏幕上的频谱瀑布图会跟系统的调度策略联动。当干扰源出现,能看到对应频段的颜色瞬间发生变化,紧接着系统自动跳频,这种眼见为实的演示比任何流程图都更有说服力。
2.3 这项技术在真实场景里怎么用
跟现场工程师交流后,我认为这套无线AI最现实的落地场景首先是工业专网。工厂里面的无线环境非常复杂,AGV小车穿梭、金属机架反射、电焊设备产生的干扰,时刻在变化,靠人工调优根本跟不上。有了在线频谱感知和自动决策能力,专网可以让网络自己保持最优状态,省去大量运维成本。
另一个被提到的高价值场景是低空通信。无人机集群和低空物流对无线链路非常敏感,一旦出现遮挡或干扰,传统切换机制很容易造成链路中断。但如果网络基站在干扰发生前就能通过频谱态势变化预测到风险,提前切换波束或加强冗余编码,通信连续性会有本质提升。这套方案的运行逻辑跟自动驾驶很像,核心就是“提前半秒替用户做决策”。
这里有个参数值得记一下:现场演示的时延预算。从信号采集到策略生效,端到端控制在两秒以内,其中很大一部分时间是留给“判断是否真发生了环境变化”的确认窗口,避免误切换。实际做类似系统时,这个确认窗口的时长往往是个需要反复调的点,太短容易抖动,太长又会错过最佳干预时机。
3. 沉浸式视频传输:点云压缩和VVC其实是同一个目标的两条路线
3.1 8K、VR、AR把传输带宽逼到了什么程度
逛到沉浸式视频区域时,工作人员先给我看了一个数据对比:一份3分钟左右的8K VR全景视频,如果用未压缩的RGB格式存储,数据量接近300GB;即便用目前主流的HEVC标准做压缩,码率也要到80Mbps左右,才能保证转头时有足够的清晰度。对于5G网络来说,这个码率勉强可以推,但对移动网络来说并不友好,更不用说给普通家庭宽带了。
到了6G时代,沉浸式视频的目标码率压缩指标几乎没有余地——业界普遍希望在保证视觉质量的前提下,把同等分辨率的码率再压低一半以上。这就是InterDigital把重点押在沉浸式视频压缩上的原因。他们在现场展出的,不是一台播放器,而是一套完整的“采集—压缩—传输—渲染”流水线,视频源来自一台多摄像头阵列实时拼接出来的点云数据,经过编码后传输到旁边的AR眼镜端进行渲染。
3.2 点云压缩方案里最核心的设计选择
点云是什么?你可以把它理解成三维空间里的粒子集合,每个粒子都有XYZ坐标和颜色信息。一台高精度激光扫描仪产生的点云每秒就有几百万个点,数据量比普通视频还要大得多。为了传输这种数据,业界已经有V-PCC和G-PCC两个思路,但实际效果还是得看各家的工程实现。
InterDigital演示的方案的亮点在于它的分块编码策略。它先把点云按空间划分成多个局部块,然后对每个块单独选择合适的几何压缩模式。有些块很平坦(比如地板、桌面),就用低阶预测;有些块结构很复杂(比如人的头发、植物的树叶),就切到高精度模式。这种方案跟编解码里面的“内容自适应”是一模一样的逻辑,但具体实现起来涉及大量块边界处理、几何和纹理属性的联合编码等问题,工程难度不小。
传输端还有一个直观优化:他们把“当前用户正在注视的视口”作为高码率区域,其余区域降为低码率做背景填充。这个技巧在VR直播里已经不新鲜,但InterDigital把它跟分块点云编码结合在一起,视口内的数据块全部高保真编码,视口外则用大幅度降采样替代,整体码率节省相当可观。
3.3 VVC在移动终端上的落地进度
除了点云,InterDigital在二维视频编码上的积累也一样拿得出手。展台上放着一排手机、平板和笔记本,跑的是同一个演示序列——一段包含大量复杂纹理和高频运动的短片,分别用HEVC和VVC两种编码器压到相同码率,然后并排显示画面。肉眼观察下,VVC在树叶抖动和字幕边缘这些区域的画质优势非常明显,几乎没有HEVC那种常见的块效应。
工作人员告诉我,他们现在主要在做的事情之一,是让VVC编码能在移动端实时跑起来。VVC压缩率高,但复杂度也比HEVC高了好几倍,早期芯片根本扛不住实时编码。现场跑通的那套方案,是利用GPU的并行能力把编码任务切到几百个线程同时处理,配合针对移动端ARM架构优化的汇编指令集,最终在旗舰级平台上实现1080P/60帧的实时编码,功耗控制在一瓦以内。这个数字在移动端非常有吸引力,意味着未来手机可能直接用VVC直播,而不需要依赖云端转码。
4. 端侧AI与人机交互:把AI推理做“轻”是一门手艺
4.1 展台上的AR交互演示到底展示了什么
沿着展台往里走,我发现最热闹的位置是一副AR眼镜的体验区。戴上眼镜,你可以看到前面桌面上悬浮着一个虚拟的机械臂模型,用手去做抓取动作,机械臂会跟着你的手指运动,一侧的屏幕上实时显示着整个手部关键点的识别状态和推理耗时。
这套体验的关键词是“端侧”。按常理来说,手部关键点识别这种任务交给云端大模型去算非常容易,但要在一个时延敏感、电池有限的AR设备上实时跑起来,对模型大小、算力占用和帧率都有硬约束。InterDigital的思路是自研一个轻量化的手部姿态估计网络,骨架主干部分用神经架构搜索(NAS)自动生成,模型参数量控制在几兆级别,配合浮点改定点的量化压缩,最终在AR眼镜这颗算力不到手机三分之一的处理器上也能跑到30FPS以上。
我特意问了一下工作人员:为什么非要端侧跑,而不是直接走5G远程渲染?回答案很直接:时延和隐私。远程渲染一到两百毫秒的往返时延会明显破坏AR交互的“跟手感”,而手部动作这种极其私密的传感器数据,很多用户也不希望传到云端处理。端侧推理不是最炫酷的方案,但它是目前技术路线里最现实、最容易被用户接受的一种。
4.2 模型瘦身和精度保持的取舍方法
我在现场跟工程师聊到了他们训练这套手部姿态模型的细节,其中很多经验和常规深度学习项目是通用的。整套流程大致分为三步:先从头训练一个大模型在校验集上刷分,再用蒸馏方法让一个小模型去模仿大模型的输出行为,最后对模型做8bit量化,并针对目标芯片做算子融合和缓存优化。
这里最容易被忽略的是第二步——知识蒸馏的作用。很多团队上来就直接用小网络训练,结果精度一直上不去。但实际上,用大模型当老师,把大模型在各类姿态上的输出“软标签”作为监督信息,小模型在中高难度手势上的准确率能提升好几个百分点。我在现场看的演示里,有一组数据对比,同样结构的小模型,纯监督训练和蒸馏训练在手部遮挡场景下的关键点平均误差差了近30%,这个差距已经足够影响交互体验了。
当然,量化也不是随便压位就能做的。工程师说他们用了一个逐步量化策略:先量化权重,保留激活值浮点,跑一轮重新校准收集分布;再尝试量化激活值,但根据每个层的敏感度决定是否跳过量化。部分层会保留浮点,部分层用8bit,混合精度方案比全量化方案能多找回一两个点精度,代价只是内存带宽稍有增加,在终端设备上是完全值得的。
4.3 这条路线对消费端产品的启发
参观完这套端侧AI演示,我最大的感受是:未来一年可能会迎来一批端侧交互产品的大爆发。除了AR眼镜,人形机器人和服务机器人也在往端侧智能方向发展。移动机器人一旦离开固定场地,通信链路不可能每次都回传服务器做决策,必须在本地完成物体识别、避障和姿态估计,这跟AR眼镜的需求本质上是一样的。
InterDigital这类公司手里握着的专利组合,恰恰覆盖了模型压缩、传感器数据处理、低功耗调度这些并肩的关键环节。我自己做过一段移动端AI开发,深知这里面的路并不好走:芯片平台的算子库是否齐全、内存带宽能不能跟上、散热功耗有没有余量,每一项都会卡住项目的进度。所以如果一个团队想在消费级设备上做端侧智能,建议从源头就定好目标芯片平台,围绕它的量化工具链和算子支持设计方案,不要先做模型再去找硬件适配,那是典型的从需求往实现方向做反了。
5. 从这次MWC26演示里,我拆到的可复用经验
5.1 衡量创新成果的“三个硬指标”
在逛展过程中,我一直在脑海里给每个演示项目做“打分表”。回头总结起来,这套评分标准其实可以拆成三个硬指标,分别对应商业价值、工程完成度和技术护城河。
第一是压缩率或效率增益。做通信和视频的成果,最终都要回归到“能不能用更少的资源干掉同样的事”这四个字上,现场展示的方案,比如点云压缩和VVC移动端实时编码,核心指标都写得很清楚:码率比上一代标准降低百分之多少,功耗压到多少毫瓦。第二是端到端时延。尤其在做无线AI和AR交互的项目时,时延是直接决定可用性的指标,算法再花哨,如果整条链路多绕了300毫秒,用户一定会甩掉设备。第三是硬件友好度。也就是方案能否在普通商用芯片上运行,而不是依赖特种设备,这一点往往被很多实验室项目忽略,却是规模化落地的关键。
用这套标准去看InterDigital的展台,会发现它几乎所有演示都符合这个逻辑。无线AI在通用处理器上跑、VVC编码在消费级手机芯片上实现、点云方案对接的也是普通商用级AR眼镜,这说明他们内部做成果评估的时候,已经在刻意用“能不能在真正量产的设备上跑”来约束研究方向了。
5.2 现场演示里那些看不见的取舍
说句实话,逛这种大厂的展台,不能只看演示成功时有多流畅,更要观察演示方案背后的取舍逻辑。第一个细节是它没有展示多用户的场景,所有交互都是单机版。这一点可以理解,毕竟在展台环境里搭建多用户通信和同步的复杂度很高,单机演示可以把变量控制到最小,突出核心能力。但作为同行,我心里清楚,多用户并发时的干扰处理和资源分配才是真正检验方案的时刻,这是实际部署时必须补的一课。
第二个细节是点云演示的视点变化。他们展示的视口切换是平滑渐变式的,没有做过快的瞬移,这对带宽评估是非常友好的设定。真正常见的VR体验恰恰是快速转身、上下探头这种大幅度视角突变,码率波动会比演示场景剧烈得多。这不是说InterDigital技术上做不到,而是说明公开演示往往倾向于展示性能最稳定的区间。
第三是现场没有公布标准的对比细节。比如VVC和HEVC对比时,是用什么码率、什么编码预设、什么质量指标?同样是VVC也有slow和fast模式之分,slow模式画质更好但编码速度慢,fast模式速度在线但压缩率打折。所以在评估一份演示数据时,一定要追问它的对照环境是否公平,这个习惯在哪都适用。
5.3 想在这个赛道跟进的人,我建议你在哪里下手
如果你看完这篇文章,也想冲着通信视频或者端侧AI这个方向做点自己的东西,结合这次InterDigital展示的技术路线,我给出几个可以直接落地的建议。
先从硬件和数据集入手。无线AI方向可以找两套软件无线电设备,一台当基站,一台当终端,然后把频段上所有干扰信号录制下来,做一个属于自己的“频谱环境变化数据集”。不用追求多豪华的设备,能用脚本控制信号源发生器的状态,就有得玩了。视频这块也一样,找一段公开授权的点云序列或8K视频源,用VTM参考软件跑一遍,记录下不同预设下的码率和PSNR/SSIM数值,建立自己的baseline。
然后再做集成层面的创新。单干编码算法很难突破参考软件,但如果你把点云分块策略跟视口自适应结合起来,大概率能做出一套有意思的方案;如果你熟悉某款手机芯片的NPU调度API,就值得把量化和蒸馏流程挂在上面做个离线工具链——这些方向都踩在本次展台展示的能力交叉点上,也就是InterDigital这几年真正在深挖的位置。
最后别忽略专利调研。做这个领域的研究,至少要翻一下VVC和V-PCC的标准提案库,搞清楚哪些方案已经被申请了专利保护。做技术方案的很多工程师都不喜欢看专利,但在这种标准驱动的领域,专利检索做得好,可以帮你避开大量后期商业化的坑。这里给一个我自己的习惯:每周固定花一小时去查新公开的标准提案,不是为了照抄,而是为了知道“这个方向已经有人做过什么”,省得重复造轮子。
6. 一些值得带回个人项目里的思考
逛完InterDigital的展台、跟工程师聊完之后,我在回酒店的公交上翻自己的笔记,越看越觉得“通信+AI+视频”这三条线的交叠,接下来会是产业链最拥挤的地方。过去展商给你看的是某个芯片多快、某个终端多薄,现在看的是智能体如何互相协作、核心算法如何驱动体验升级。从现场的人气和咨询量判断,这次InterDigital的几个演示区域内几乎全程有人追问,大家关心的已经不再只是“专利技术”,而是“下一代网络和终端里,我的产品能怎么用上这些能力”。
我自己印象最深的还是端侧AI那套手部交互方案。它教会我的一件事是:在资源受限的设备上做好一个功能,比在云端堆算力做出一个效果要难得多,也因此更有技术含量。现场他们能把一个实时推理模型压缩到几兆字节并保持稳定帧率,这套工程流本身就有很强的复用价值。做类似产品时,我建议你先把手上的模型结构简化,再把数据蒸馏做扎实,最后才考虑量化部署,顺序不要颠倒。
最后分享一个观展小技巧:逛MWC这种大展会时,与其盯着大展台看产品Demo,不如多花点时间跟那些技术型公司的工程师面对面聊。展台屏幕上的参数和展板的宣传语很容易注水,但工程师现场给出的解释和回答,往往能让你快速判断这项成果的真实成熟度。InterDigital这次给每台演示设备旁边都配了真人工程师,全程没放什么宣传片,但这种把事情讲透的展示方式,才是对专业观众最大的尊重。8. 扫码登记信息时,顺便要了一份技术白皮书,回来后我会按里面给的测试序列和工具配置再复跑一轮数据,把现场看到的指标变成自己能复核对的数据,这才算没有白跑一趟MWC。