LiteRT-LM 上手指南:语言模型边缘推理库,在手机上实测有多快
2026/9/24 17:24:57 网站建设 项目流程

LiteRT-LM 上手指南:语言模型边缘推理库,在手机上实测有多快

【免费下载链接】LiteRT-LMLiteRT-LM is Google's production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.项目地址: https://gitcode.com/GitHub_Trending/li/LiteRT-LM

LiteRT-LM 是谷歌开源的语言模型边缘推理库,让你把大语言模型直接跑在手机、电脑甚至树莓派上,不用依赖云端 API。本文用官方实测数据帮你判断速度够不够用,并说清上手前要注意的限制,适合想本地跑大模型的开发者。

为什么要在自己设备上跑模型

以前想在应用里用上大模型,基本只有两条路:调云端 API,或者自己搭一套推理环境。前者每次请求都等网络往返、按量计费,代码和聊天记录还得离开你的设备;后者配置麻烦,普通项目用不起。

LiteRT-LM 就是来解决这个问题的。它把模型加载、推理调度、硬件加速这些脏活累活都包了,你拿到一个现成的.litertlm模型文件就能直接跑,数据全程留在本地。

它基于 LiteRT(可以理解为谷歌的轻量级模型运行时)做编排,模型文件里打包了推理所需的全部组件,量化版本还能进一步压缩体积。

实测有多快:官方数据速览

先说结论:小模型在端侧的速度完全够用,GPU 主要加速"预填充"(一次性处理输入文本的阶段),解码(逐字生成输出)提升有限。

模型设备后端预填充 tokens/秒解码 tokens/秒
Gemma3-1BM3 MacBook ProCPU603.883.0
Gemma3-1B三星 S24 UltraGPU2369.052.5
Gemma3n-E2BM3 MacBook ProCPU232.527.6
Gemma3n-E2B三星 S24 UltraGPU816.415.6
Gemma3n-E4B三星 S24 UltraGPU548.09.4

几个可以直接带走的判断:

  • 1B 小模型在手机 CPU 上就能跑出每秒 50+ 字的解码速度,日常对话场景没问题。
  • 4B 级别的模型手机上解码约每秒 9 字,能看,但别指望秒回。
  • 想再快一点,可以开 MTP 多 token 预测草稿器,官方称推理速度最高能提升 3 倍。

哪些设备、哪些场景能用

  • 平台覆盖广:Android、iOS、Web、桌面(macOS / Windows / Linux)和树莓派这类 IoT 设备都能跑。
  • 硬件加速:GPU 和 NPU 都能用,同一份模型在不同设备上自动挑合适的后端。
  • 多模态:除了文本,还支持图片、音频输入,仓库里甚至带了语音识别和 TTS 的实验模块。
  • 工具调用:内置 function calling 支持,模型能直接调你应用里的函数,做本地 Agent 不用绕云端。
  • 多语言 API:C++、Python、Kotlin 已稳定,Swift、JavaScript 处于早期预览,还有社区维护的 Flutter 绑定。

手机端实际跑起来大致是这个效果(仓库自带的 Android 演示动画):

想深入看源码的话,运行时核心代码、Python 封装、支持的模型模板 都在仓库里,目录结构很清晰。

上手前要知道的事

  • 最快上手方式是 CLI,两行命令就能跑通,不用写代码:

    uv tool install litert-lm装好工具,再用litert-lm run加上 Hugging Face 仓库名和一句话提示词即可。

  • 模型支持是精选制:目前覆盖 Gemma、Gemma3n、Qwen、Llama、Phi-4 等家族,不是所有模型都能直接塞进去,用之前先确认你的模型在支持列表里。

  • API 成熟度分档:Python、Kotlin、C++ 是稳定版;Swift 和 JavaScript 还是早期预览,生产环境用它们要留好踩坑时间。

  • 项目本身很成熟:它已经在 Chrome、Chromebook Plus、Pixel Watch 这些谷歌产品上跑着,不算实验性玩具,但个别后端(比如 NPU 路径)还在迭代,遇到兼容问题先看发行说明。

总的来说,如果你的需求是"数据不出设备、离线可用、按自己的节奏迭代",LiteRT-LM 是目前端侧跑语言模型最省事的路线之一。先用 CLI 跑一个小模型试试速度,比看十篇文章都直观。

【免费下载链接】LiteRT-LMLiteRT-LM is Google's production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.项目地址: https://gitcode.com/GitHub_Trending/li/LiteRT-LM

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询