VeriLoop E2现已正式开源. 基于Qwen3.8-27B后训练, 面向代码Agent, 数学, 科学推理与长程可验证任务, 共1,841,831条训练数据.
核心算法为VeriLoop-Governed Recurrence (VGR). 模型负责提出与重规划, 外部证据裁决候选状态. 只有受保护约束不回退, 且至少一个证据维度严格改善时才提交.
截至目前, VeriLoop E2完成9项公开评测. SWE-bench Pro 76.2, Terminal-Bench 2.1 88.8, Terminal-Bench 3.0 29.7, Terminal-Bench 4.0 37.9, DeepSWE v1.1 64.6, SWE-Marathon v1.1 45.0, AIME 2026 98.3, GPQA Diamond 93.9, MathArena Apex 2025 89.6.
同时, 团队发布完整GGUF精度梯度, 从BF16到IQ1_M. 低比特版本直接由BF16构建, 不做二次量化, 统一使用冻结BF16 logits配对评测. Q6_K为20.566 GiB, 相比BF16缩小58.96%, PPL与BF16在统计误差内保持一致.
IQ1_M为16.790078 GiB, 相比BF16缩小66.4955%, PPL漂移仅+0.3191%, Mean KLD 0.014357, Same top-p 95.870%, log-PPL相关性99.62%. IQ1_M不是统一1-bit模型, 而是保护关键张量的混合精度方案, 有效密度5.36 BPW, 并通过原生llama.cpp与真实MTP验证, 104个draft token接受76个, 接受率73.0769%.
此外, 团队还公开通过VeriLoop E2推进黎曼猜想ζ函数的Demo, 形成67.350003708785593%的严格有限维计算辅助证书, 并继续积极推进可形式化Lean证明.
主模型:
https://huggingface.co/tsinghua-sigs-robot-lab/VeriLoop-E2
GGUF:
https://huggingface.co/tsinghua-sigs-robot-lab/VeriLoop-E2-GGUF