LiteRT-LM 上手指南:语言模型边缘推理库,在手机上实测有多快
【免费下载链接】LiteRT-LMLiteRT-LM is Google's production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.项目地址: https://gitcode.com/GitHub_Trending/li/LiteRT-LM
LiteRT-LM 是谷歌开源的语言模型边缘推理库,让你把大语言模型直接跑在手机、电脑甚至树莓派上,不用依赖云端 API。本文用官方实测数据帮你判断速度够不够用,并说清上手前要注意的限制,适合想本地跑大模型的开发者。
为什么要在自己设备上跑模型
以前想在应用里用上大模型,基本只有两条路:调云端 API,或者自己搭一套推理环境。前者每次请求都等网络往返、按量计费,代码和聊天记录还得离开你的设备;后者配置麻烦,普通项目用不起。
LiteRT-LM 就是来解决这个问题的。它把模型加载、推理调度、硬件加速这些脏活累活都包了,你拿到一个现成的.litertlm模型文件就能直接跑,数据全程留在本地。
它基于 LiteRT(可以理解为谷歌的轻量级模型运行时)做编排,模型文件里打包了推理所需的全部组件,量化版本还能进一步压缩体积。
实测有多快:官方数据速览
先说结论:小模型在端侧的速度完全够用,GPU 主要加速"预填充"(一次性处理输入文本的阶段),解码(逐字生成输出)提升有限。
| 模型 | 设备 | 后端 | 预填充 tokens/秒 | 解码 tokens/秒 |
|---|---|---|---|---|
| Gemma3-1B | M3 MacBook Pro | CPU | 603.8 | 83.0 |
| Gemma3-1B | 三星 S24 Ultra | GPU | 2369.0 | 52.5 |
| Gemma3n-E2B | M3 MacBook Pro | CPU | 232.5 | 27.6 |
| Gemma3n-E2B | 三星 S24 Ultra | GPU | 816.4 | 15.6 |
| Gemma3n-E4B | 三星 S24 Ultra | GPU | 548.0 | 9.4 |
几个可以直接带走的判断:
- 1B 小模型在手机 CPU 上就能跑出每秒 50+ 字的解码速度,日常对话场景没问题。
- 4B 级别的模型手机上解码约每秒 9 字,能看,但别指望秒回。
- 想再快一点,可以开 MTP 多 token 预测草稿器,官方称推理速度最高能提升 3 倍。
哪些设备、哪些场景能用
- 平台覆盖广:Android、iOS、Web、桌面(macOS / Windows / Linux)和树莓派这类 IoT 设备都能跑。
- 硬件加速:GPU 和 NPU 都能用,同一份模型在不同设备上自动挑合适的后端。
- 多模态:除了文本,还支持图片、音频输入,仓库里甚至带了语音识别和 TTS 的实验模块。
- 工具调用:内置 function calling 支持,模型能直接调你应用里的函数,做本地 Agent 不用绕云端。
- 多语言 API:C++、Python、Kotlin 已稳定,Swift、JavaScript 处于早期预览,还有社区维护的 Flutter 绑定。
手机端实际跑起来大致是这个效果(仓库自带的 Android 演示动画):
想深入看源码的话,运行时核心代码、Python 封装、支持的模型模板 都在仓库里,目录结构很清晰。
上手前要知道的事
最快上手方式是 CLI,两行命令就能跑通,不用写代码:
uv tool install litert-lm装好工具,再用litert-lm run加上 Hugging Face 仓库名和一句话提示词即可。模型支持是精选制:目前覆盖 Gemma、Gemma3n、Qwen、Llama、Phi-4 等家族,不是所有模型都能直接塞进去,用之前先确认你的模型在支持列表里。
API 成熟度分档:Python、Kotlin、C++ 是稳定版;Swift 和 JavaScript 还是早期预览,生产环境用它们要留好踩坑时间。
项目本身很成熟:它已经在 Chrome、Chromebook Plus、Pixel Watch 这些谷歌产品上跑着,不算实验性玩具,但个别后端(比如 NPU 路径)还在迭代,遇到兼容问题先看发行说明。
总的来说,如果你的需求是"数据不出设备、离线可用、按自己的节奏迭代",LiteRT-LM 是目前端侧跑语言模型最省事的路线之一。先用 CLI 跑一个小模型试试速度,比看十篇文章都直观。
【免费下载链接】LiteRT-LMLiteRT-LM is Google's production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.项目地址: https://gitcode.com/GitHub_Trending/li/LiteRT-LM
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考