“4个月后交付AGI”这种说法,最近在圈子里热度很高。很多人第一反应是“又要画饼了”,也有人会认真问:AGI到底能不能被交付,多模态是不是就是通往AGI的那条路。本文不打算站队,而是从技术视角拆开这个话题:AGI是什么、多模态AGI为什么被频繁提起、当前工程上能做到什么程度、距离“可交付”还差哪些关键能力。无论你是做算法、做后端,还是做系统架构,这篇文章都想帮你建立一条相对完整的技术判断链。
1. AGI 与多模态 AGI:我们需要先对齐概念
1.1 什么是 AGI
AGI 全称是 Artificial General Intelligence,中文一般叫“通用人工智能”。它指的是机器能够在多个领域、多种任务上,像人类一样进行理解、学习、推理和行动,而不是只在一个窄任务上超越人类。
日常我们接触到的 AI 产品,比如智能客服、推荐系统、人脸识别、语音助手,本质上都是“窄人工智能”(ANI,Artificial Narrow Intelligence)。它们只能解决某个单一问题,模型换一个领域几乎就要重新训练。AGI 的差异在于“通用性”:同一个系统,既能写代码,也能做物理实验设计,还能看懂医学影像,并在这些任务之间迁移知识。
不过,学术界对 AGI 并没有统一的标准。有人认为“通过了图灵测试就算”,有人提出“可以在大多数经济工作中达到人类水平”,还有人把 AGI 定义为“具备跨领域学习和自我改进能力的自主智能体”。定义不同,交付标准自然也不同。
1.2 多模态 AGI 为什么被频繁提起
“多模态”指的是文本、图像、音频、视频、传感器数据等多种信息形态。多模态 AGI 则强调:一个通用智能系统,需要能同时处理和理解多种模态信息,并在此基础上完成推理和决策。
过去几年,大语言模型(LLM)让机器在纯文本任务上有了质的飞跃,但人类获取信息的渠道从来不只是文字。一张产品截图、一段会议录音、一个视频操作步骤,都包含比文本更丰富的信息。如果 AI 只能“看文字”,它就很难真正理解现实世界。因此,多模态成了从“大语言模型”走向“通用智能”的一个关键方向。
现在很多产品已经在做多模态融合:比如图片问答、视频理解、语音交互、OCR 文档解析。但从“能处理”到“能理解并采取行动”,中间还有巨大的鸿沟。后面我们会看到,这条路远不是把几个模型拼在一起那么简单。
2. 从“口号”到“技术拆解”:AGI 可交付吗
2.1 “4个月交付”背后的工程语境
“4个月后交付 AGI”听起来很具体,但站在工程技术角度,“交付 AGI”和“交付一个 App”是完全不同量级的事情。一个 App 有明确的版本号、功能边界、验收标准;AGI 没有。
更常见的现实是:研究团队在某个阶段取得突破后,会先发布 Demo,再逐步开放 API,随后变成产品能力。这个过程中,“交付”往往不是一个瞬间,而是一系列阶段性发布。
所以对这类时间点表述,更合理的理解是:团队内部给自己设定了一个“里程碑节点”,希望在此时间点之前,把当前技术整合成一个够接近 AGI 体验的原型系统。至于它是否达到真正意义上的通用智能,还需要通过大量评测和场景验证。
2.2 AGI 能力分层模型
为了不让“AGI”这个概念飘在空中,工程上可以把它拆成若干能力层。下面是一个常见的分层方式:
| 能力层 | 说明 | 当前成熟度 |
|---|---|---|
| 感知层 | 理解文字、图像、声音、视频,甚至触觉、嗅觉信号 | 文字和图像较成熟,视频与物理信号仍在爬坡 |
| 认知层 | 记忆、推理、规划、知识迁移 | 大模型已有初步能力,但稳定性不足 |
| 行动层 | 使用工具、调用 API、操作软件、控制机械臂 | Agent 方向快速进展,但可靠性和安全性是瓶颈 |
| 自我进化层 | 自主设定目标、收集反馈、持续改进 | 仅有少量低风险场景下的实验 |
| 对齐与安全层 | 确保目标符合人类意图、避免有害行为 | 研究活跃,但远未收敛 |
如果把这五个层当成一个“AGI 交付清单”,你会发现大部分团队在感知层和认知层已经有不少成果,但行动层和自我进化层还处在早期。所谓“交付 AGI”,更像是指把这些能力整合成一套可用的系统,而不是一次性解决所有科学问题。
3. 多模态 AGI 的技术栈与实现路径
3.1 核心技术组件
要搭建一个多模态 AGI 原型系统,至少需要以下几个组件:
- 多模态编码器:把图像、音频、视频等信号转换成模型可以处理的向量表示。
- 统一语义空间:让文字、图像、声音在同一个向量空间里可以互相检索和推理。
- 推理与规划模块:基于当前状态和用户目标,生成执行步骤。
- 记忆模块:短期记忆保存当前任务上下文,长期记忆沉淀跨任务经验。
- 工具调用层:模型输出结构化指令,调用搜索引擎、代码解释器、数据库等外部工具。
- 安全与对齐模块:判断输出是否安全,是否符合用户真实意图,必要时阻断操作。
这七个组件并不是孤立运行的。它们通常需要在一个事件循环里协作:感知输入 → 理解意图 → 规划步骤 → 调用工具 → 观察结果 → 更新记忆 → 生成最终回复。
3.2 当前三条主流技术路线
路线一:大语言模型扩展多模态
这是目前产品化最快的一条路。它的思路是:在已经很强的文本大模型外面,加一层图像/音频编码器,并训练一个“投影层”把多模态特征对齐到文本空间。典型如各类多模态大模型。这种路线的优点是数据好找、训练相对稳定、能快速上线多模态问答能力;缺点是模型本质上仍然以“文本思维”为主,对复杂物理世界的理解能力有限。
路线二:世界模型路线
世界模型希望让模型学到“世界如何运转”的因果规律。例如:看到一只杯子从桌上掉落,能预测它会向下落并可能摔碎。这种预测能力不靠死记硬背,而是靠对物理过程建立内部模拟。如果这条路走通,模型就能像人类一样在脑海中“推演未来”,再决定下一步动作。难度比前者高很多,因为它需要更丰富的时空数据和更复杂的训练目标。
路线三:具身智能与 Agent 路线
这条路线强调“行动反馈”。AGI 不能只在云端回答问题,还要能在数字世界或物理世界中执行任务。具身智能把模型接入机器人、无人车、智能终端,通过传感器感知环境,通过执行器影响环境,再从环境的反馈中持续学习。
整体来看,当前产品级多模态 AGI 更接近路线一和路线三的混合:先用多模态大模型做理解,再通过 Agent 框架完成工具调用和任务闭环。
4. 一个最小多模态感知训练流程示例
为了帮助大家理解多模态 AGI 的训练和评测不是玄学,下面给出一个极简的工程示例。这个示例不追求复现某个大模型,只用来展示“多模态模型训练”的基本流程。
4.1 数据准备与处理
假设我们要训练一个“图文问答”模型。输入是一张图片和一个问题,输出是自然语言答案。第一步是把图片、文本整理成统一的训练样本。
# 文件路径:prepare_data.py from PIL import Image import torch from torch.utils.data import Dataset class ImageTextDataset(Dataset): def __init__(self, samples, tokenizer, processor): """ samples: 列表,每个元素是 {"image_path": str, "question": str, "answer": str} tokenizer: 文本分词器 processor: 图像处理器,负责把图片转成 tensor """ self.samples = samples self.tokenizer = tokenizer self.processor = processor def __len__(self): return len(self.samples) def __getitem__(self, idx): sample = self.samples[idx] image = Image.open(sample["image_path"]).convert("RGB") pixel_values = self.processor(image, return_tensors="pt").pixel_values text = sample["question"] inputs = self.tokenizer(text, return_tensors="pt", padding="max_length", truncation=True, max_length=64) labels = self.tokenizer(sample["answer"], return_tensors="pt", padding="max_length", truncation=True, max_length=64).input_ids return { "pixel_values": pixel_values.squeeze(0), "input_ids": inputs.input_ids.squeeze(0), "attention_mask": inputs.attention_mask.squeeze(0), "labels": labels.squeeze(0), }这段代码的核心思路是:将图片通过processor变成像素向量,将问题通过tokenizer变成 token,将答案作为监督标签。真正做数据工程时,你还需要考虑图片分辨率、数据清洗、多轮对话格式、混合模态配比等问题。
4.2 模型结构示意
一个最简的多模态模型可以用“视觉编码器 + 投影层 + 语言模型”来搭建。视觉编码器负责提取图像特征,投影层负责把图像特征映射到语言模型能理解的空间。
# 文件路径:model.py import torch.nn as nn class SimpleMultimodalLLM(nn.Module): def __init__(self, vision_encoder, projector, language_model): super().__init__() self.vision_encoder = vision_encoder self.projector = projector self.language_model = language_model def forward(self, pixel_values, input_ids, attention_mask, labels=None): # 1. 图像特征 vision_features = self.vision_encoder(pixel_values) # 2. 投影到文本空间 projected_features = self.projector(vision_features) # 3. 拼接文本 token 与图像 token,送入语言模型 # 这里为了简化,假设语言模型支持 cross-attention outputs = self.language_model( input_ids=input_ids, attention_mask=attention_mask, encoder_hidden_states=projected_features, labels=labels, ) return outputs实际工程中,你可能会选择已有的开源视觉编码器(如 SigLIP、CLIP 等)和语言模型,然后只冻结一部分参数,训练投影层和部分语言模块。这样能显著降低训练成本。
4.3 训练与评测框架
训练配置用 YAML 维护,方便实验管理:
# 文件路径:configs/multimodal.yaml model: vision_encoder: openclip/SigLIP projector_hidden_size: 2048 language_model: qwen2.5-7b-instruct freeze_vision_encoder: true freeze_language_model: false data: batch_size: 16 max_length: 64 image_dir: ./data/images annotation_file: ./data/annotations.jsonl training: epochs: 3 learning_rate: 5e-5 optimizer: adamw fp16: true logging_steps: 50 save_steps: 500启动训练和评测可以使用命令行:
# 启动分布式训练 python -m torch.distributed.run --nproc_per_node=8 train.py --config configs/multimodal.yaml # 在验证集上评测 python evaluate.py --checkpoint ./checkpoints/step_1500.pt --config configs/multimodal.yaml4.4 运行与结果解释
训练完成后,模型可以在一个简单的问答接口里使用:
# 文件路径:inference.py def predict(image_path, question): image = load_image(image_path) prompt = f"请根据图片回答:{question}" response = model.generate(image=image, text=prompt, max_new_tokens=128) return response当模型在测试集上拿到不错的 BLUE / ROUGE / 人工评分时,说明它已经学会了一些图文对齐能力。但要注意,这只是多模态 AGI 的起点。真正复杂的是如何让模型在连续多轮交互中保持目标一致,并在面对模糊输入时主动提问澄清,而不是一味“自信输出”。
5. 部署一套“AGI 原型系统”需要关注什么
5.1 系统架构建议
从单模型 demo 走向可部署的多模态 AGI 系统,架构上通常需要切成几个模块:
- 入口层:接收用户文本、图片、音频、视频,做格式校验和去重。
- 编排层:一个长期运行的 Agent 运行环境,负责对话状态管理、工具调度、任务拆解。
- 模型层:多模态大模型、向量检索模型、重排序模型、安全分类模型。
- 记忆层:这里可以用 Redis 存短期 session,用向量数据库存长期事实。
- 工具层:内置代码解释器、浏览器搜索、数据库查询、第三方 API 适配器。
- 可观测层:请求链路追踪、token 用量统计、打分回调、操作审计日志。
这种分层的好处是:即使底层模型换版本,上层 Agent 流程和安全策略可以保持不变。
5.2 推理与工具调用设计
“能推理”和“会调用工具”是两件事。一个合理的 Agent 执行循环大概是这样:
- 接收用户请求。
- 调用多模态模型解析意图。
- 如果信息不足,先调用检索工具补齐背景。
- 生成候选执行步骤。
- 在沙箱里执行代码或调用工具。
- 观察工具返回结果。
- 如果结果异常,回溯并重试。
- 最终生成答案给用户。
每一步都需要有日志和上限次数,避免 Agent 陷入死循环。尤其要设置单轮任务的最大时长、最大 token 消耗、最大工具调用次数。
5.3 可观测性与安全护栏
多模态 AGI 带来的新风险是“模型看到了图片里的敏感信息后,仍然输出不安全内容”。所以系统需要在模型前后各加一道防护:
- 输入侧:对图片做 OCR 检测、暴力内容过滤;对文本做提示注入检测。
- 输出侧:对模型输出做关键词和语义风险评估,禁止执行高风险工具。
- 审计侧:记录每次工具调用的输入、输出、决策原因,方便事后追溯。
安全不是一个开关,而是一组策略叠加。最稳妥的做法是“最小授权”:Agent 默认只能访问完成当前任务所需的最小工具集合。
6. 常见问题与排查思路
在实际训练和部署多模态 AGI 系统时,大家经常遇到下面几类问题,整理成表格方便排查。
| 问题现象 | 常见原因 | 解决思路 |
|---|---|---|
| 多模态模型回答与图片无关 | 图像特征没有有效注入语言模型 | 检查图像 token 是否参与注意力计算,尝试加大投影层容量 |
| 图片分辨率很低导致识别错误 | 数据预处理时压缩过度 | 设置合适的分辨率,或在训练时使用多尺度增强 |
| 模型总是重复同一句话 | 生成参数中 repetition_penalty 过低或训练数据单一 | 调高 repetition_penalty,检查数据多样性 |
| Agent 调用工具后拿到错误结果还继续用 | 缺少结果校验和重试机制 | 增加工具结果 schema 校验,失败后自动重试或换工具 |
| 多模态模型幻觉严重 | 图像细节无法被模型“看到”,或训练数据噪声过大 | 提高图像 token 数量,添加幻觉评测集,训练时引入拒绝回答 |
| 训练时显存溢出 | batch size 过大或模型所有参数都参与训练 | 冻结部分模块,使用梯度累积、混合精度、LoRA 微调 |
排查训练问题时,我的习惯是先看“数据对不对”,再看“loss 降不降”,最后看“生成结果差在哪一步”。很多时候,问题不是模型能力不够,而是输入数据格式不统一,或者评测指标选错了。
7. 最佳实践与工程建议
7.1 数据质量大于模型大小
对多模态模型来说,数据质量直接影响上限。与其堆海量图文对,不如认真做一轮清洗:
- 过滤图文不匹配的样本。
- 过滤包含敏感信息或异常文本的样本。
- 对不同模态数据做比例配比,避免文本语料过强导致图像特征被忽略。
- 为每个测评场景保留一个小而精的人工标注集。
7.2 评测要贴近真实场景
很多模型在公开 benchmark 上分数很高,一到真实业务场景就露馅。原因是 benchmark 分布太单一。建议自建一套业务评测集,包含模糊提问、长上下文、多轮不一致、图文矛盾、恶意输入等场景。每次模型迭代都要回归。
7.3 渐进式发布与灰度策略
多模态 AGI 系统不要一次全量开放。更稳妥的做法是:
- 先内部小范围试用。
- 再对一小部分真实用户开放,收集反馈。
- 根据错误类型决定是调数据、调模型还是改流程。
- 最后再扩大流量。
同时要设计“降级方案”:当模型服务不可用时,系统能切换到规则客服或经典检索流程,而不是直接报错。
7.4 关注成本与延迟
“交付 AGI”听上去很酷,但算力账单不会陪你浪漫。多模态模型通常体积大,推理成本高。工程上可以做:
- 模型蒸馏,合并视觉编码器和语言模型。
- 使用 KV Cache 和量化推理。
- 对简单问题走小模型通道,复杂问题才调用大模型。
- 对多媒体输入做缓存,避免重复计算图像特征。
8. 学习路线与后续方向
如果你刚刚接触多模态和 AGI,想系统学习,可以参考下面的思路:
- 第一阶段:学透一个大语言模型的基本原理,理解 Transformer、Attention、预训练和微调。
- 第二阶段:学习多模态模型的基础结构,比如 CLIP、LLaVA、Qwen-VL 的实现方式。
- 第三阶段:动手做一个小型多模态问答模型,用自己的数据集跑通训练和评测流程。
- 第四阶段:研究 Agent 框架,比如如何让模型调用工具、如何管理多轮任务状态。
- 第五阶段:关注安全对齐和可解释性,这些是 AGI 能否真正落地的关键。
一个比较重要的提醒是:不要被“某天交付 AGI”的说法带偏节奏。技术迭代是渐进的,模型能力会越来越强,但工程交付物始终是“能力边界清晰、可评测、可回滚的系统”。与其争论 AGI 到底哪一天来,不如把精力放在打磨感知、决策、行动、安全这些具体能力上。把这些能力拼装好,AGI 才会从愿景变成一个可用的产品。