二、大模型推理与基座层
• vLLM:UC Berkeley 开源的大模型推理引擎,核心创新 PagedAttention 技术让单 GPU 吞吐量提升数倍,支持 200+ 模型架构,适配 NVIDIA、昇腾等几乎所有主流硬件,是工业场景本地大模型部署的事实标准。
• Ollama:本地大模型部署工具,将复杂的模型下载、环境配置全部封装为命令行操作,几分钟即可在边缘工控机上启动 Qwen2.5 等工业适配模型,Docker 镜像构建失败率低于 0.2%,生产稳定性极强。
• SGLang:高性能推理优化框架,从请求全链路路径做加速,RadixAttention 技术进一步提升批处理效率,适合工业场景高并发的实时推理需求,推理延迟比常规方案降低 30% 以上。
详情请参考