☰
刚刚:35B 开源 Agent 模型上线 OpenRouter,开源模型开卷“API 生意“
2026/10/11 10:44:06 网站建设 项目流程

刚刚:35B 开源 Agent 模型上线 OpenRouter,开源模型开卷"API 生意"

【免费下载链接】Nex-N2.5-mini项目地址: https://ai.gitcode.com/hf_mirrors/nex-agi/Nex-N2.5-mini

当一家模型厂商把权重开源到 Hugging Face、把入口挂上 OpenRouter,这背后不只是"多了一个试用渠道",而是一场分发逻辑的转向:开源模型不再只靠开发者自己下载、自己起服务,而是直接进入一个按 token 计费、OpenAI 兼容、开箱即用的全球 API 市场。

Nex-AGI 刚刚把 Nex-N2.5 家族的 mini 与 Pro 双双挂上 OpenRouter,其中 Nex-N2.5-mini 是一款 35B 级的轻量多模态 Agent 模型。这篇文章结合 OpenRouter 上的真实 API 文档与本仓库源码,拆解这次上架的三层含义:新的分发通道、社区实操的接入方式,以及对本地部署派"API 还是自托管"的账。

一、OpenRouter 上架意味着什么:开源模型的新分发通道

在 README.md 的首页,Nex-N2.5 的入口列表里除了 GitHub、Hugging Face 与官网,还赫然列着两条 OpenRouter 链接(Pro 与 mini)。这并非简单的"加个渠道",它标志着开源模型商业化的又一个节点:

第一,托管即服务,权重与 API 分道扬镳。模型权重照常开源(本仓库即 mini 的完整权重,16 个 safetensors 分片,由 model.safetensors.index.json 索引,total_size约 70.2GB,bfloat16),但想立刻跑起来的人不必再为"两张 H100"操心——OpenRouter 上已经有服务在跑,充值、拿 key、发请求即可。

第二,OpenAI 兼容协议成为事实标准。从 OpenRouter 模型页可见,Nex-N2.5-mini 以标准的 Chat Completions API 对外提供,且公开声明的可选参数包括reasoning、reasoning_effort、temperature、top_k、top_p、max_tokens、logprobs等。这意味着现有的 OpenAI SDK 生态、LangChain 等 Agent 框架,改一行model字段就能切过来。

第三,Agent 模型比聊天模型更需要"平台级路由"。Agent 任务往往要跑几万 token 的推理轨迹,中间还伴随工具调用与环境反馈的反复迭代。OpenRouter 的多 provider 路由与按量计费,天然适配这种"长耗时不挑单次质量"的负载形态——这正是 Agent 模型与 API 市场互相需要的地方。

二、社区最新实操:接入、调参与生产实践

社区中已经出现"Nex-N2.5 上线 OpenRouter:接入、调参与生产实践指南"这类跟进文章,核心操作其实非常简单,一切围绕 OpenAI 兼容接口展开。

接入:一个 curl 即可完成首调

curl -X POST https://openrouter.ai/api/v1/chat/completions \ -H "Authorization: Bearer $OPENROUTER_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "nex-agi/nex-n2.5-mini", "messages": [ {"role": "user", "content": "Explain how binary search works."} ] }'

响应结构与 OpenAI 完全一致:choices[].message返回正文,usage中带有 token 数与费用估算;开启stream: true则返回 SSE 流式数据。生产环境需要重点处理的是错误码语义——400 为参数不支持、401/403 为鉴权与限额、429 需退避重试、502 为上游生成失败(该场景不扣费),这套约定与主流模型 API 完全对齐,接入成本几乎为零。

调参:用reasoning_effort控制思考模式

Nex-N2.5 的核心卖点是"自适应思考",这一点在 chat_template.jinja 中体现得淋漓尽致:模板会依据reasoning_effort决定是否输出<think>推理块——"none"直接回答、"high"强制思考、"medium"让模型自行判断要不要思考。README 的采样建议是temperature=0.7, top_p=0.95, top_k=40,OpenRouter 侧同样开放这三个参数。Agent 场景的常见做法是:首轮用medium快筛、关键决策点切high,把推理预算花在刀刃上。

生产要点:函数调用与推理解析是 Agent 的骨架

Agent 不是"能聊天",而是"能干活"。仓库里的 chat_template.jinja 内置了完整的工具调用协议:系统提示中注入<tools>声明,模型以<tool_call><function=...><parameter=...></function></tool_call>的 XML 结构发起调用,工具结果以<tool_response>回灌,并支持多步工具循环(模板会反向扫描确保最后一个 user 消息是真实查询而非工具回包)。本地以 SGLang 部署时,需配套--tool-call-parser qwen3_coder与--reasoning-parser qwen3才能正确解析这两种特殊输出——这是从"能生成文本"到"能驱动工具"的关键一跳。

三、Agent 能力从哪来:仓库源码里的工程细节

OpenRouter 上的模型与服务能力并非凭空而来,仓库里的一行行配置揭示了它的"血统"。

config.json 显示其model_type为qwen3_5_moe:40 层结构,256 个 MoE 专家、每个 token 激活 8 个(num_experts_per_tok: 8),并带 shared expert;注意力采用"线性注意力 + 全注意力"交替(full_attention_interval: 4,每 4 层插入一次全注意力),max_position_embeddings达 262144——即 262K 长上下文,足够容纳一条长程 Agent 任务的全部探索轨迹。视觉侧由 processor_config.json 支持图像与视频输入(Qwen3VLProcessor,temporal patch 采样),这正是"通过视觉反馈感知环境、验证结果、推进任务"的硬件基础。

权重侧,model.safetensors.index.json 显示总权重约 70.2GB(bfloat16),16 分片。之所以 35B 级模型权重体积这么大,是因为 256 个专家全部落盘;实际推理时单 token 只激活 8 个专家,显存占用与算力消耗远低于全量加载的直觉。社区已有实践把同系模型经 mlx 静态混合量化压到 17.8GB、峰值内存约 17.9GB,推理约 50 tokens/s;也有安卓端 GGUF(Q4_K_M)落地对比的工程复盘——这些都在说明同一件事:这个模型从云上 API 到本地边缘,每一档硬件都有对应的姿势。

部署层面的"官方姿势"也写得很清楚:mini 单节点 2×H100、--tp 2,配合定制 SGLang fork 镜像nexagi/sglang:v0.5.18-nex-patch,并建议开启--mamba-scheduler-strategy extra_buffer以应对长推理轨迹下的调度压力——这套参数就是官方在 OpenRouter 背后跑服务的"参考配置"。

四、对本地部署派的影响:API 还是自托管?

上架 OpenRouter 之后,"API 还是自托管"第一次成为值得摆上桌面算的账。

自托管派的核心筹码是三样:数据不出域、按量可控、可微调。Agent 场景会反复把业务数据喂进上下文(代码库、数据库 Schema、企业内部文档),自托管在合规上无可替代;且 config.json 的 bfloat16 全精度权重支持继续预训练与微调,这是 API 永远给不了的。2×H100 的门槛对个人开发者不低,但对有合规需求的团队而言,这笔基建投入是"买数据主权"。

API 派的核心筹码则是时间与边际成本。先不算硬件折旧,光是把 SGLang 定制 fork、推理解析器、函数调用解析器、长上下文调度这整套环境调通,就足以劝退不少"只想验证 Agent 效果"的团队。OpenRouter 按 token 计费,把前期的环境成本摊薄为零——尤其适合 PoC、爬坡期产品与偶发高负载。

一个现实的混合策略正在成为社区共识:先 API 验证效果,把链路、参数与工具协议跑通,再在业务稳定后迁回自托管,甚至用 API 作为自托管集群的弹性溢出通道。因为两边的"接口语言"是一致的——OpenAI 兼容的 Chat Completions、同一份reasoning_effort语义、同一套工具调用协议,迁移成本被压到了最低。

结语

把权重开源到社区、把 API 挂上 OpenRouter,Nex-AGI 实际上同时踩中了两条增长曲线:一条是开源生态的信任曲线(可审计、可微调、可私有化),一条是 API 市场的效率曲线(即开即用、按量付费)。当 35B 级 Agent 模型把"思考、工具调用、多模态感知"这些能力以标准协议公开售出,开源模型之间的竞争就正式从"谁的权重能下载"进入"谁的 API 更好用"的下半场。对开发者而言,这是最好的时代:能力在门口,路费按 token 算,随时可以转身自建。

【免费下载链接】Nex-N2.5-mini项目地址: https://ai.gitcode.com/hf_mirrors/nex-agi/Nex-N2.5-mini

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询