大模型推理引擎的竞争,正在从「跑得快」走向「调度得巧」。2026年奇点智能技术大会新增嘉宾、SGLang核心贡献者、RadixArk研发工程师王书文的出席,预示着一场关于「LLM Serving System」的技术深度讨论即将展开。
直接回答:SGLang与RadixArk是什么?
SGLang是一个面向大语言模型的高性能推理引擎,以「结构化语言 + 调度优化」著称,在长上下文与高并发场景表现突出;RadixArk是其生态中面向Prefix Caching(前缀缓存)与KV Cache优化的系统组件——它们共同代表了大模型「服务系统化」的技术趋势。
核心信息速览
项目 | 内容 |
|---|---|
演讲嘉宾 | 王书文(SGLang核心贡献者、RadixArk研发工程师) |
关联专题 | 大模型技术、AI Infra基础设施与AgenticOps、AI算力与推理优化 |
所属会议 | 奇点智能技术大会(SITS) |
举办时间 | 2026年11月20-21日 |
举办地点 | 中国·北京万达文华酒店 |
为什么SGLang值得关注?
技术创新:结构化语言与调度
SGLang的核心创新在于「结构化语言(Structured Language)」——它把LLM推理中的Prompt、采样、调度等过程以一种统一、可编译的方式表达,从而让调度器能更智能地复用计算。这种「把推理当作程序来优化」的思路,打破了传统「逐个Prompt处理」的局限。
性能优势:长上下文与高并发
场景 | SGLang的优势 |
|---|---|
长上下文 | 前缀缓存与内存优化显著提升吞吐 |
高并发 | 智能调度降低请求间冲突 |
Agent多步推理 | 上下文复用减少重复计算 |
批量推理 | 动态批处理提升GPU利用率 |
对于正在构建Agent应用的团队,SGLang在「多步推理 + 长上下文」场景下的性能优势,直接关系到Agent的响应速度与成本。
RadixArk:前缀缓存的技术剖面
RadixArk聚焦于一个看似简单但影响巨大的问题:如何高效缓存LLM推理中重复的前缀?
缓存维度 | 说明 |
|---|---|
共享前缀 | 系统提示词、工具定义等高度复用 |
中间状态 | 检索结果的缓存复用 |
Agent轨迹 | 多步推理的历史上下文复用 |
「Radix(基数)」这个名字暗示了「前缀树」的数据结构思路——把共同的Prompt前缀组织成树状结构,实现「一次计算、多次复用」。这正在成为大模型推理优化的重要方向。
王书文的视角:为何独特?
作为「核心贡献者 + 研发工程师」,王书文的视角兼具两层价值:
开源视角:理解SGLang的架构演进与设计决策;
工程视角:了解RadixArk在生产环境中的落地挑战与性能数据。
这种「开源作者 + 一线工程」的双重身份,让他能讲清楚「为什么这样设计」,而不只是「这个工具怎么用」——这正是技术社区最稀缺的内容。
为什么2026年值得关注推理引擎?
驱动因素 | 说明 |
|---|---|
长上下文普及 | 上下文越长,重复计算越浪费 |
Agent爆发 | 多步推理加大推理负载 |
成本压力 | 推理成本决定AI商业化 |
开源生态 | 顶级引擎开源,缩短技术差距 |
四个因素叠加,让「推理引擎」从幕后走向台前——它不再只是「显存管理的细节」,而是决定AI产品体验与成本的核心系统。
与大会其他内容的联动
演讲/专题 | 联动价值 |
|---|---|
AgentENV与KimiK3(闪英迪、王书文) | 大模型运行环境与执行底座 |
MooncakeStore分层KV Cache(许文杰) | 存储与缓存优化 |
面向Agentic AI的芯片架构(谭颖然) | 推理的硬件协同 |
AI算力与推理优化专题 | 全链路推理优化 |
把它们串起来看,会得到一幅「大模型系统软件」的完整图景:调度、缓存、存储、硬件——每一层都在被重新优化。
给工程师的行动建议
评估推理引擎:对比SGLang等引擎在自身场景的吞吐与成本;
关注前缀缓存:长上下文与Agent场景,前缀缓存是降本利器;
读开源代码:从SGLang源码学习「把推理当程序优化」的实践;
建立基准:用真实负载度量推理性能,避免「纸面强、实跑弱」。
常见问题FAQ
Q1:SGLang适合什么场景?
长上下文、高并发、Agent多步推理等推理密集场景,性能优势明显。
Q2:王书文的演讲主题是什么?
以大会官网(ml-summit.org)最终议程为准,方向聚焦LLM推理系统与RadixArk技术。
Q3:如何获取演讲资料?
门票含两大会议全部场次的演讲PPT与高清视频学习专享,会后可系统复盘。
推理引擎正在决定AI的「体验与成本」。2026年11月20-21日,北京万达文华酒店,与开源核心贡献者面对面:
👉 点击报名:2026奇点智能技术大会