☰
GEV-26B-Decide 入门教程:一个API调用搞定是/否、评分与多选决策
2026/10/8 18:29:48 网站建设 项目流程

GEV-26B-Decide 入门教程:一个API调用搞定是/否、评分与多选决策

【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-Decide

GEV-26B-Decide 是一个开源的自适应思考决策模型,基于 Gemma-4-26B(约 4B 活跃参数)构建。它把"决策"变成了一次标准 API 调用:是/否判断、0–5 评分、2–256 个选项的多选,一次请求就返回每个选项的校准概率,还能在模型不确定时自动"想一想"再作答。它在 Decision Index 0.2.1 上取得62.48的平衡能力分,且单条决策只需约 45 ms。

30秒了解:一个引擎,两种思考模式

GEV-26B-Decide 的核心设计是"快慢系统",就像人脑的 System 1 / System 2:

模式工作方式典型延迟
System 1(快速直觉)一次前向推理直接输出所有选项的校准概率约 45 ms
Adaptive thinking(自适应思考)System 1 置信度低于阈值(默认 0.8)时,自动调用 System 2 逐步推理,再与快速答案等权重合并视思考长度而定
System 2(慢思考)原版 Gemma-4 思考模式,处理文本与图像约 250 tokens/s

关键点:思考只在需要时发生。官方在 1,754 道验证题上测得:自适应模式只让 47.8% 的请求进入思考,却拿到了"永远思考"96% 的收益,整体准确率从 73.3% 提升到 83.4%,且概率校准度(ECE 0.035)完全不变。

一个接口搞定三类决策:noul / score / choice

所有决策都走同一个POST /v1/decide接口,只需用kind字段切换类型:

kind用途输出
noul是/否判断(如"客户是否在要求退款?")["false", "true"]两项概率
score0–5 分打分(如服务质量评分)6 档概率分布
choice多选一,支持2–256 个选项每个选项一项校准概率

请求只需提供四要素:state(决策背景,可为文本、JSON 或"文本+图片"混合)、question(一个问题)、options(多选时必填)、thinking(off/auto/on)。

curl localhost:8000/v1/decide -H 'Content-Type: application/json' -d '{ "kind": "choice", "state": "A bat and a ball cost $1.10 in total. The bat costs $1.00 more than the ball.", "question": "How much does the ball cost?", "options": ["$0.10", "$0.05", "$1.00", "$0.55"], "thinking": "auto"}'

响应包含options、probabilities、choice(最可能的选项)、choice_index、usage,开启思考时还会附带thinking: {"used": ..., "think_tokens": ...}。想调试?加return_reasoning/debug字段即可看到 System 2 的完整推理过程和两套分布。

其他实用参数:

  • threshold:auto模式下触发思考的置信度阈值,默认 0.8;
  • think_budget:思考 token 上限;
  • strategy:超过 16 个选项时的读取策略,默认tournament(分组赛制,全部选项都读取、不剪枝)。

5分钟快速部署:下载权重 + 一条启动命令

本地部署只需两步(需要一张 80GB 显存的 GPU,如 B200 / RTX PRO 6000):

# 方式一:HuggingFace 下载 hf download autotrust/GEV-26B-Decide --local-dir GEV-26B-Decide # 方式二:git 克隆仓库 git clone https://gitcode.com/hf_mirrors/autotrust/GEV-26B-Decide # 启动服务(vLLM,监听 :8000) bash GEV-26B-Decide/serve.sh

serve.sh 实际调用的是 serve_decide.py——一个标准 vLLM OpenAI 服务,额外挂上了POST /v1/decide路由。它只加载一份权重:普通请求走 System 2(OpenAI 兼容端点/v1/chat/completions),带jev-decisionLoRA 模块(adapter_vllm/)的请求则走 System 1 决策路径。

⚠️ 部署注意:

  • 需要支持 Gemma-4 的 vLLM 版本,并应用补丁 patches/vllm-gemma4-lm-head-lora.patch(Gemma-4 绑定lm_head的 LoRA 支持);
  • 追求更快思考?用MTP=1 bash serve.sh开启推测解码,System 2 提速约 1.8–1.9 倍(247 → 438 tokens/s),代价是高并发下 System 1 吞吐下降;
  • 若绕过服务直接调/v1/completions,请显式传top_k: 0和top_p: 1.0,否则生成配置的默认采样参数会截断返回的概率。

自适应思考怎么用才聪明:开与不开的场景

官方用真实谜题做了直观验证(System 1 单轮 vs 自适应思考):

谜题问题System 1自适应
扫雷哪格一定安全21.0%86.0%
Wordle哪个词符合全部颜色反馈52.0%100.0%
四子棋哪列能赢或封锁54.0%99.5%
数独高亮格填哪个数76.0%99.5%

在知识推理基准上收益同样明显:GPQA Diamond 42.9% → 78.6%、BBH 75.0% → 92.0%、MMLU-Pro 65.0% → 84.6%、CRUXEval(代码)67.5% → 90.7%。完整游戏数据见 reports/thinking_games.json,决策指数明细见 reports/decision_index_adaptive.json。

但也要记住边界:

  • 🧠开auto:科学、数学、代码、逻辑、多跳问答等"能逐步校验"的推理题;
  • 🚫保持off:意图分类、检索、工具路由——这些任务 System 1 本身就很强(如 BFCL 94.4%),强行思考收益极小,甚至在 BANKING77 上会把 macro-F1 从 88.0 拉到 85.0;
  • ⏱️思考是有成本的:不思考约 0.05 秒;8,192 token 的思考最长可达约 33 秒(B200 单卡估算)。延迟详情见 reports/adaptive_latency_summary.json。调低threshold或think_budget可以"用准确率换速度"。

让概率可信:两套温度校准文件

模型输出的概率是校准过的(System 1 与自适应模式 ECE 均为 0.035),这是它区别于普通 LLM 输出的核心价值。仓库提供两套温度文件:

  • calibration.json:默认值(noul 1.003 / choice 1.017 / score 0.999),Decision Index 评测所用;
  • calibration_gold.json:对照标准答案重新校准的版本。如果你要根据置信度门控自动操作(例如"概率 > 0.9 才自动执行"),建议换用它。

决策头的结构定义(24 槽位布局、softcap 30、读出方式)在 judge_config.json 和 head.safetensors 中,权重本体见 config.json 与两份分片 safetensors。

不止文本:图像决策与计算机操作

同一套权重、同一个 vLLM 引擎同时吃文本和图片(内置 Gemma-4 视觉编码器):

  • 合成图像测试(颜色/形状/数字/红物体判断)各 100%;VL-RewardBench 78.4%;
  • 计算机使用:截图中每个可点击元素标上编号框,System 1 单次决策选下一个点击,约 85 ms/步,60 个多步任务完成 95%,比同家族大模型快 3 倍;
  • 机械臂抓取:仅凭顶部相机画面做"左右/上下"二选一,61 ms/决策;
  • 支持最长256K上下文(128K 内实测定位单句关键信息 100% 正确),255 个选项的意图分类仍有 89% 准确率。

每回合的原始结果在 reports/demos/cu_results.json 与 reports/demos/arm_servo.json。

主要文件速览

文件说明
serve_decide.py · serve.shvLLM 服务端与启动脚本(含/v1/decide)
adapter/System 1 的 PEFT LoRA(transformers 路径使用)
adapter_vllm/vLLM 版 System 1:主干 LoRA + 决策头 lm_head LoRA
head.safetensors · judge_config.json24 槽位决策头与读出配置
calibration.json · calibration_gold.json两套温度校准
chat_template.jinja · tokenizer.json模板与分词器
reports/自适应思考验证、决策指数、延迟与游戏数据
patches/vLLM 的 Gemma-4 lm_head LoRA 补丁

上线前必读:已知局限

  • 专家级难题(HLE)System 1 低于随机水平,思考也只是拉回随机线;国际象棋类任务从思考中获益甚微;
  • 思考在难题上很慢,知识推理基准未达 Decision Index 的 1,000 ms 延迟门槛——实时场景请保持thinking: "off";
  • 图像决策是零样本(未专门微调);超过 128K 的上下文尚未验证;
  • 英文为主;涉及高风险的自动化决策,务必用calibration_gold.json做置信度门控。

小结

GEV-26B-Decide 把"判断"这件事做成了最简单的 API:state + question + options进去,校准概率出来;不确定时它自己知道该想一想。一条serve.sh即可部署,一套权重同时服务快速直觉与深度推理,是构建决策型 Agent 的高性价比起点。

【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-Decide

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询