UNILM 项目生态全景:跨任务、语言与模态的大规模自监督预训练技术指南
2026/9/13 23:53:32 网站建设 项目流程

UNILM 项目生态全景:跨任务、语言与模态的大规模自监督预训练技术指南

【免费下载链接】unilmLarge-scale Self-supervised Pre-training Across Tasks, Languages, and Modalities项目地址: https://gitcode.com/GitHub_Trending/un/unilm

导读

本文是微软 UNILM 开源项目家族的完整技术导航指南。UNILM(仓库根目录 README.md)以"跨任务、语言和模态的大规模自监督预训练"(Large-scale Self-supervised Pre-training Across Tasks, Languages, and Modalities)为核心主线,汇聚了从基础架构(DeepNet、X-MoE、RetNet、LongNet)、基础模型(Kosmos、BEiT、WavLM、LayoutLM 系列、E5 等)到工具链(s2s-ft、Aggressive Decoding)与应用(TrOCR、LayoutReader)的完整研究矩阵。读完本文,你将掌握 UNILM 生态的总体架构、各子项目定位与对应仓库目录、关键模型的发布历史与版本脉络,以及如何按图索骥在仓库中快速定位代码、预训练模型与微调示例,为深入某个具体模型的研究与工程落地提供起点。

项目定位:The Big Convergence(大汇聚)

UNILM 生态的核心命题是一句话:大规模自监督预训练在任务(task)、语言(language)与模态(modality)三个维度上的"大汇聚"

  • 任务维度:同时覆盖预测式(predictive)与生成式(generative)任务,例如 UniLM 统一了 NLU 与 NLG;
  • 语言维度:覆盖 100+ 种语言,例如 InfoXLM/XLM-E、DeltaLM/mT6 的多语言与跨语言预训练;
  • 模态维度:覆盖纯语言、图像、音频、布局/格式+语言、视觉+语言、音频+语言等组合,例如 LayoutLM 系列做文档 AI,Kosmos 系列做多模态大语言模型(MLLM),WavLM/VALL-E 做语音。

这一理念直接映射到仓库的目录组织上:根目录下每个一级子目录就是一个独立的研究项目,围绕"语言 → 视觉 → 语音 → 多模态"展开,形成一张层次清晰的模型矩阵。

一、Foundation Architecture:基础架构研究

TorchScale 与 DeepNet:千层 Transformer 的训练稳定性

TorchScale 是 UNILM 基础架构研究的载体库,其研究方向聚焦于基础模型的建模通用性与能力、训练稳定性与效率四大目标。其中最具标志性的成果是 DeepNet:将 Transformer 扩展到 1000 层以上(deepnet/README.md 记载其论文《DeepNet: Scaling Transformers to 1,000 Layers》于 2022 年 3 月发布)。

DeepNet 解决的是深度 Transformer 训练不稳定的经典难题——通过改造残差连接与初始化方式(DeepNorm),使得极深网络无需特殊技巧即可稳定收敛,为后续更大规模模型提供了架构地基。

Foundation Transformers(Magneto)与长度外推

在通用性方向上,生态引入了Foundation Transformers(Magneto):面向"真正的通用建模"(语言、视觉、语音、多模态),其论文标题即"towards true general-purpose modeling across tasks and modalities"。该架构在仓库中的落地代表是 BEiT-3——beit3/README.md 明确指出其骨干采用Magneto 解耦 Multiway Transformer架构,"Magneto can have better training stability and obtain better performance across modalities",实现基于 torchscale 包。

在能力方向上,生态提出了长度外推(Length-Extrapolatable)Transformer,使模型在训练序列长度之外仍能保持良好表现,这一能力在后来的 LongNet/LongViT 中进一步放大。

X-MoE:可扩展且可微调的稀疏专家混合

X-MoE 是可扩展且可微调的稀疏 Mixture-of-Experts(MoE)。MoE 通过条件计算将不同 token 路由到不同专家子网络,在扩大参数量级的同时控制计算成本;X-MoE 特别强调 MoE 的可微调性,解决稀疏专家模型在下游任务微调中常见的退化问题。官方发布说明将其与 DeepNet 并称为"Transformers at Scale"的两大支柱。

架构革命:BitNet、RetNet 与 LongNet

除上述"渐进式"工作外,UNILM 生态还发布了三个被认为具有"架构革命"意义的模型:

  • BitNet:1-bit Transformer,将权重极端量化(1-bit)以服务大规模语言模型,仓库中 bitnet/README.md 与配套的《The-Era-of-1-bit-LLMs__Training_Tips_Code_FAQ.pdf》给出了训练技巧与 FAQ;
  • RetNet:Retentive Network,提出以"保留机制"(retention)替代自注意力,被定位为 Transformer 的后继者之一;
  • LongNet:将 Transformer 扩展到 10 亿 token 序列,通过稀疏注意力(dilated attention)的线性复杂度设计实现超长序列建模。

二、Foundation Models:基础模型矩阵

(M)LLM 的演进:Kosmos 系列与 MetaLM

多模态大语言模型(MLLM)是生态中最前沿的一条主线:

  • Kosmos-2.5:多模态读写模型(A Multimodal Literate Model),面向文本密集型图像的机器阅读。它擅长两个互补的转录任务:一是生成空间感知文本块(每个文本块被赋予图像内的空间坐标),二是生成结构化 markdown 输出(把样式与结构捕获为 markdown 格式)。该能力通过共享的 decoder-only 自回归 Transformer + 任务特定 prompt + 灵活文本表示统一实现。kosmos-2.5/README.md 提供了完整的推理说明:安装要求 Flash Attention 2,仅支持 Ampere/Ada/Hopper GPU(如 A100、RTX 3090/4090、H100);推理入口为 kosmos-2.5/inference.py,通过--do_ocr切换 OCR 任务、--do_md切换 image-to-markdown 任务;针对极端长宽比图像,可用--use_preprocess配合--hw_ratio_adj_upper_span "[1.5, 5]"--hw_ratio_adj_lower_span "[0.5, 1.0]"将图像归一化到典型长宽比以提升效果。该 README 同时明确提醒:生成式模型存在幻觉风险,无法保证图中所有 OCR/Markdown 结果绝对准确
  • Kosmos-2:将多模态大语言模型接地到世界(Grounding MLLM),使模型能定位并指称图像中的实体,支持指代表达理解等任务;
  • Kosmos-1:多模态大语言模型(MLLM),能感知通用模态、上下文学习(few-shot)与指令跟随(zero-shot);
  • MetaLM:语言模型作为通用接口(Language Models are General-Purpose Interfaces),将语言模型作为连接语言/多语言、视觉、语音、多模态各类基础模型的统一接口层。

语言与多语言模型

这是 UNILM 名字的源头,也是生态中最成熟的一支:

  • UniLM(v2)与 unilm-v1:统一语言模型预训练,把双向语言模型(autoencoding)与序列到序列语言模型(partially autoregressive)统一到同一框架。unilm/README.md 记载 UniLMv2 采用Pseudo-Masked Language Model(PMLM)目标(ICML 2020);unilm-v1/README.md 则给出 v1(NeurIPS 2019)的完整微调实操:基于pytorch-transformers v0.4.0,用biunilm/run_seq2seq.py做 seq2seq 微调、biunilm/decode_seq2seq.py做 beam 解码,覆盖 Gigaword/CNN-DM 摘要生成、SQuAD 问答生成等任务;同时发布unilm1-large-cased(24 层、1024 hidden、16 头、约 340M 参数)与 unilm1-base-cased(12 层、768 hidden、12 头、约 110M 参数)两个 cased 模型,其配置与词表文件可在 storage/ 目录中找到(如unilm-large-cased-config.jsonunilm-base-cased-vocab.txt);
  • InfoXLM / XLM-E:100+ 语言的多语言/跨语言预训练模型
  • DeltaLM / mT6:面向 100+ 语言生成与翻译的encoder-decoder 预训练
  • MiniLM:小而快的预训练模型,用于语言理解与生成(含 MiniLMv2 的多头自注意力关系蒸馏,ACL 2021);
  • AdaLM:预训练模型的领域、语言与任务适配
  • EdgeLM:面向边缘/终端设备的小型预训练模型;
  • SimLM:面向相似度匹配的大规模预训练;
  • E5:文本嵌入(text embeddings),其模型矩阵见 e5/README.md:从E5-small/base/large(12/12/24 层,384/768/1024 维)到-unsupervised(仅无监督数据预训练)版本,再到multilingual-e5-*多语言系列,直至E5-mistral-7b-instruct(32 层、4096 维、以 LLM 为骨干)的完整梯度;
  • MiniLLM:大语言模型知识蒸馏

视觉模型

  • BEiT/BEiT-2:BERT 式图像 Transformer 预训练("BERT Pre-Training of Image Transformers")。beit/README.md 给出模型规格:BEiT-base 为 12 层/768 hidden/16 头/patch 16x16(约 86M 参数),BEiT-large 为 24 层/1024 hidden/16 头(约 304M 参数),并提供 ImageNet-22k 自监督预训练、以及"预训练+中间微调"两套权重;BEiT-2 引入向量量化视觉 tokenizer(VQ-VKD)做掩码图像建模;
  • DiT:文档图像 Transformer 的自监督预训练,支撑文档图像分类、版面分析、表格检测与 OCR 文本检测等视觉型 Document AI 任务,其代码分classificationobject_detectiontext_detection等子目录;
  • TextDiffuser/TextDiffuser-2:扩散模型作为"文字画家",实现可控文本渲染与文字图像生成,两个版本各有完整的训练/推理脚本(如train.pyinference.py)。

语音模型

  • WavLM:面向全栈语音任务的语音预训练(在 SUPERB 基准上取得当时 SOTA),模型实现在 WavLM.py 与 modules.py;
  • VALL-E:神经编解码语言模型(neural codec language model)用于 TTS,其零样本 TTS 能力源于将语音离散化为 codec token 后按语言模型方式建模。

多模态(X + Language):文档与跨模态模型

  • LayoutLM/LayoutLMv2/LayoutLMv3:文本 + 布局/格式 + 图像 的多模态文档基础模型(Document Foundation Model),服务扫描件、PDF 等 Document AI 场景。layoutlmv3/README.md 详述其以统一文本与图像掩码(unified text and image masking)+ word-patch alignment 跨模态对齐目标做预训练,使其同时胜任文本中心(表单理解、票据理解、文档 VQA)与图像中心(文档图像分类、版面分析)任务,并给出 FUNSD 表单理解的分布式微调命令示例(--segment_level_layout 1 --visual_embed 1 --input_size 224等关键开关);
  • LayoutXLM:多语言文档基础模型,并配套多语言表单理解基准 XFUND(含中、日、西、法、意、德、葡 7 种语言);
  • MarkupLM:针对HTML/XML 等标记语言的预训练(文本嵌入 + 位置嵌入 + XPath 嵌入);
  • XDoc:跨格式文档理解的统一预训练,单一模型处理多种文档格式;
  • UniSpeech 系列(UniSpeech、UniSpeech-SAT):ASR 的自监督+监督统一预训练、说话人感知的通用语音表示学习;
  • SpeechT5、SpeechLM:口语处理的 encoder-decoder 预训练、引入未配对文本增强的语音预训练;
  • VLMo:统一视觉-语言预训练(以 BEiT 为视觉骨干);
  • VL-BEiT:生成式视觉-语言预训练——BEiT 向多模态的演进(统一预训练任务、共享骨干、单阶段训练);
  • BEiT-3:通用多模态基础模型,被定位为"The Big Convergence"(跨任务、语言、模态大汇聚)的重要里程碑。beit3/README.md 提供BEiT3-base(12 层/768 hidden/约 276M 参数)与BEiT3-large(24 层/1024 hidden/约 746M 参数)等多档权重,以及配套 sentencepiece 分词器beit3.spm(可用XLMRobertaTokenizer加载);并给出使用建议:需要深度融合的 V-L 任务推荐 base/large 原始版,检索类任务推荐-itc(图文对比中间微调)版。

三、Toolkits:序列生成工具链

  • s2s-ft:sequence-to-sequence 微调工具包,基于 PyTorch 微调预训练 Transformer 做序列生成,仓库内run_seq2seq.pydecode_seq2seq.pygen_seq_from_trace.py构成"训练-解码-重打分"完整链路(s2s-ft 目录下的脚本与 unilm-v1 的 biunilm 用法一脉相承);
  • Aggressive Decoding(decoding/):无损且高效的 seq2seq 解码算法。其思想是:对于输入输出高度相似的 seq2seq 任务(如语法纠错、文本简化),以输入为引导一次生成多个 token,得到与自回归贪婪解码完全一致的结果同时大幅提速。仓库 decoding/ 内含 GAD(Generalized Aggressive Decoding)与 IAD(Input-guided Aggressive Decoding)两套实现及配套 fairseq 代码。

四、Applications:落地应用

  • TrOCR:基于 Transformer 的 OCR。作为端到端文本识别方案,它用 Transformer 同时做图像理解与 bpe 级文本生成(卷积无关)。trocr/README.md 给出模型档位:TrOCR-Small 约 62M / Base 约 334M / Large 约 558M 参数,在 IAM(手写)与 SROIE(打印票据)上有公开评测结果,并提供 fairseq 与 HuggingFace 两种格式的权重与微调流程;
  • LayoutReader:文本与布局的阅读顺序检测预训练,可显著改善开源与商业 OCR 引擎的文本行排序;
  • XLM-T:多语言 NMT,使用预训练跨语言编码器。

五、周边生态:LLMOps 与 RedStone

除模型与工具外,生态还关联两个配套项目:

  • LLMOps:面向 LLM/MLLM 使能通用技术的仓库;
  • RedStone:为大语言模型策展通用、代码、数学与问答数据的数据工程仓库(2024 年 12 月发布)。

六、发布历史与时间线(News)

UNILM 生态的 News 板块记录了从 2019 年到 2024 年的完整演进,是理解模型代际关系的最佳索引(以下为原文要点整理,模型链接均已转换为仓库内路径):

2024 年

  • 12 月:RedStone 数据策展仓库发布。

2023 年

  • 12 月:LongNet 与 LongViT 发布;
  • 12 月:TextDiffuser-2 模型、代码与 demo 发布;
  • 9 月:Kosmos-2.5(文本密集型图像机器阅读的多模态读写模型)论文发布;
  • 5 月:TextDiffuser 模型与代码发布;
  • 3 月:BEiT-3 预训练模型与代码发布;Kosmos-1(可感知通用模态、上下文学习、指令跟随的 MLLM)发布;
  • 1 月:VALL-E(TTS 语言建模方法)发布。

2022 年

  • 11 月:TorchScale 0.1.1 发布;TrOCR 获 AAAI 2023 接收;XDoc BASE 模型发布;
  • 9 月:TrOCR BASE/LARGE 场景文本识别(STR)模型发布;BEiT v2 代码与预训练模型发布;
  • 8 月:BEiT-3 论文发布;SimLM 发布;
  • 7 月:SimLM 相似度匹配大规模自监督预训练;
  • 6 月:DiT 与 LayoutLMv3 获 ACM Multimedia 2022 接收;MetaLM 发布;VL-BEiT 发布;LayoutLMv3 中文版发布;
  • 5 月:Aggressive Decoding 代码发布;
  • 4 月:DeepNet + X-MoE("Transformers at Scale");LayoutLMv3 发布;EdgeFormer 发布;
  • 3 月:DiT 发布(文档布局分析、文档图像分类 demo)。

2021 年

  • 11 月:多语言翻译规模化(10000 语言对);MarkupLM 发布;VLMo 发布(基于 BEiT 的统一视觉-语言预训练);
  • 10 月:WavLM Large 在 SUPERB 取得当时 SOTA;WavLM 发布;TrOCR 上线 HuggingFace;
  • 9 月:T-ULRv5(即 XLM-E/InfoXLM)登顶 XTREME 榜单;LayoutLM-cased 上线 HuggingFace;TrOCR(基于 BEiT 与 RoBERTa)发布;
  • 8 月:LayoutLMv2/LayoutXLM 上线 HuggingFace;LayoutReader 发布;DeltaLM 发布;BEiT 上线 HuggingFace;
  • 7 月:BEiT 发布("Towards BERT moment for CV");
  • 6 月:LayoutLMv2、LayoutXLM、MiniLMv2、AdaLM 发布;
  • 5 月:LayoutLMv2、InfoXLMv2、MiniLMv2、UniLMv3、AdaLM 获 ACL 2021 接收;
  • 4 月:LayoutXLM(多语言 LayoutLM)发布,同时引入 XFUND 多语言表单理解基准;
  • 3 月:InfoXLM 获 NAACL 2021 接收。

2020 年

  • 12 月:LayoutLMv2 发布;
  • 10 月:T-ULRv2(InfoXLM)登顶 XTREME;
  • 9 月:MiniLM 获 NeurIPS 2020 接收;
  • 7 月:InfoXLM(多语言 UniLM)发布;
  • 6 月:UniLMv2 获 ICML 2020 接收;LayoutLM 获 KDD 2020 接收;
  • 4 月:多语言 MiniLM 发布;
  • 2 月:UniLM v2、MiniLM v1、LayoutLM v1、s2s-ft v1 集中发布。

2019 年

  • 9 月:UniLM v1 发布(NeurIPS 2019,统一语言模型预训练的开端)。

七、仓库结构与快速导航

整个仓库以"一个子目录一个项目"的方式组织,按研究主题可快速定位:

主题目录
基础架构deepnet/、xmoe/、bitnet/、retnet/、longnet/
(M)LLMkosmos-2.5/、kosmos-2/、kosmos-1/、metalm/、Diff-Transformer/
语言与多语言unilm/、unilm-v1/、infoxlm/、deltalm/、minilm/、adalm/、edgelm/、simlm/、e5/
视觉beit/、beit2/、beit3/、dit/、textdiffuser/、textdiffuser-2/、longvit/
语音wavlm/、valle/、speecht5/、speechlm/、beats/
多模态文档layoutlm/、layoutlmv2/、layoutlmv3/、layoutxlm/、markuplm/、xdoc/、layoutreader/、vlmo/、vl-beit/
工具与训练s2s-ft/、decoding/、PFPO/、ReSA/、LatentLM/
应用trocr/、xlmt/
配置与词表storage/(UniLM cased 模型的 config 与 vocab 文件)

克隆仓库后即可从任意子项目的 README 出发,按其"Installation → Pretrained Models → Fine-tuning/Inference"的标准结构复现工作流。需要说明的是,不同子项目对运行环境有各自约束,例如 kosmos-2.5 依赖 Flash Attention 2(Ampere/Ada/Hopper GPU)、unilm-v1 的混合精度训练需要特定版本 NVIDIA/apex,动手前应先核对对应子目录的 requirements 与 README 前提条件。

八、许可与联系

项目采用根目录 LICENSE 文件声明的开源许可,部分源码基于 transformers 项目(unilm-v1 基于 pytorch-transformers v0.4.0),并遵循 CODE_OF_CONDUCT.md 行为准则。使用预训练模型遇到问题可在仓库提交 Issue;其他沟通可联系项目维护团队(详见根目录 README.md 的 Contact Information 部分)。

【免费下载链接】unilmLarge-scale Self-supervised Pre-training Across Tasks, Languages, and Modalities项目地址: https://gitcode.com/GitHub_Trending/un/unilm

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询