最近有关Kimi K3.1的消息,让不少开发者重新翻出一个问题:如果项目还在用 Kimi K2,要不要等下一版再迁移?
先把时间线说清楚:Kimi K3 已于 2026 年 7 月发布,并非预计 10 月才登场。至于社交平台流传的“K3.1 内部标识”和 10 月发布日期,目前不宜当作已确认的产品信息。能做实际选型比较的,是已经发布的 K3 与 K2 系列。:chatgpt-content-reference{index=“0”}
K3 相比 K2,变了什么?
| 项目 | Kimi K2 原版 | Kimi K3 |
|---|---|---|
| 总参数 | 约 1 万亿 | 约 2.8 万亿 |
| 激活参数 | 约 32B | 约 104B |
| 上下文长度 | 128K | 最高 100 万 token |
| 图像理解 | K2 原版以文本任务为主 | 原生视觉能力 |
| 主要定位 | 编程、知识任务、工具使用 | 长程编程、复杂知识工作、推理及视觉任务 |
参数与上下文数据来自 Moonshot 的 K2 仓库及 K3 技术报告。参数更多不等于每个任务都按相同比例变好;特别是百万 token 上下文,仍需用自己的长文档任务测试质量和耗时。:chatgpt-content-reference{index=“1”}
想核对具体型号时,可以在阅读测评的同时打开AIOAE 开源模型导航,查找 Kimi 系列,再进入 Moonshot 官方模型卡确认版本。AIOAE AI Resource Lab是独立运营的人工智能资源平台;导航适合作为选型入口,API 是否仍可用及实时价格应以 Moonshot 官方页面为准。
基准测试:K3 是否全面领先?
Moonshot 在 K2 发布时报告,Kimi K2 Instruct的 LiveCodeBench v6pass@1为53.7%,SWE-bench Verified 在其Agentic Coding、单次尝试设置下为65.8%。这些数据说明 K2 发布时已有不错的编程表现。:chatgpt-content-reference{index=“2”}
K3 技术报告则显示,它在多项长程编程、智能体和知识工作测试中取得更高成绩。例如报告列出的Terminal-Bench 2.1 为 88.3%、GPQA Diamond 为 93.5%。不过,K3 和 K2 发布报告采用的测试任务、运行工具与评估设置不完全相同,不能把两份报告中的分数直接相减,称为“K3 提升了多少百分点”。上述成绩也不是本文独立复测结果。:chatgpt-content-reference{index=“3”}
更明确的变化是能力范围:K3 加入原生视觉能力,官方将其用于结合截图与代码的开发任务;对于只做简短文本问答的项目,这项提升未必能直接转化为收益。:chatgpt-content-reference{index=“4”}
价格:K2 与 K3 谁更划算?
截至本文核查时,Moonshot 官方模型列表显示:原版kimi-k2系列 API 已于 2026 年 5 月 25 日停止维护和支持。因此,不能拿一份旧 K2 价目表,当作今天仍可购买的官方报价。:chatgpt-content-reference{index=“5”}
若你关心的是“留在 K2 家族附近的现行型号,还是改用 K3”,官方平台目前列出的参考价格如下,单位均为美元/百万 token:
| 当前型号 | 输入 | 输出 | 适合优先考虑的任务 |
|---|---|---|---|
| Kimi K2.6 | $0.95 | $4.00 | 日常对话、视觉及通用智能体任务 |
| Kimi K2.7 Code | $0.95 | $4.00 | 以编程为主的任务 |
| Kimi K3 | $3.00 | $15.00 | 长程编程、复杂知识工作和深度推理 |
价格来源:Moonshot 官方 API 平台当前展示的标准输入、输出价格;缓存命中另有计价,实际账单还取决于 token 用量和请求方式。按表面单价计算,K3 的输入约为 K2.6 的3.2 倍、输出为3.75 倍。因此,“K3 更强”不自动意味着“每项工作用 K3 更省钱”。:chatgpt-content-reference{index=“6”}
到底要不要切换?
如果你还在调用原版 K2 API,应着手迁移。官方已将该系列列为停止支持;先确认现有请求使用的准确模型 ID,再测试替代型号的输出格式和任务结果。:chatgpt-content-reference{index=“7”}
如果你已使用 K2.6 或 K2.7 Code,不必仅因 K3 发布就全面切换。可以抽取一批真实任务,同时记录三项数据:完成质量、每项任务实际 token 成本,以及响应时间。复杂、多步骤、需要看图或处理很长上下文的任务,优先试 K3;较短且成本敏感的任务,保留现有型号可能更合适。
如果你在等 K3.1,先不要根据爆料制定迁移计划。等官方公布模型卡、API 型号、价格和可复现的测试条件,再与 K3 做同条件比较。
对开发者来说,真正有用的“Kimi K3 vs K2”结论不是一句谁赢了,而是:原版 K2 API 已停止支持;K3 提供更大的上下文和更广的能力,但官方 API 单价也更高。从 AIOAE 开源模型导航找到对应模型资料后,用自己的工作负载跑一次对比,才能知道哪一版值得你付费使用。