☰
败率从4%击穿1%!不堆参数,如何靠“本体论”逼近完美?
2026/10/2 20:50:54 网站建设 项目流程

刚刚,我们的“极简五子棋AI”又进化了。

在前作中,我们用不到10万参数的BERT分类器,仅凭3x3井字棋的训练,就在15x15的五子棋竞技场中拿下了88.6%的胜率,证明了“智能的本质在于对本体论的精准抽象”。

但这还不够。这两天,我们对这套“本体论”架构进行了一次深度迭代。先上最新战报:

在与Random(随机策略)的1000局对战中,败局从前一版的44局骤降至10局以内,败率从4%直接击穿1%大关。

从目前的复盘来看,这仅存的不到1%的败局,几乎全是因为我们没有教过它如何回避“双三”禁手。

这也引出了上一篇文章发布后,一位朋友提出的灵魂拷问:

“完全信息的棋类游戏不是有必胜棋谱么?为啥你的模型没有自动优化抽象到这一层去?”

答案其实藏在我们的实验设计里:正如前文所述,这是一个完全信息场景,但我们故意对模型进行了“信息遮蔽”,没有教它双三的规避逻辑。

为什么要这么做?因为现实世界从来不是完全信息的。通过可控地过滤信息,我们实际上是在模拟模型在非完备信息场景(阴性场景)下的表现,并以此作为对照测试。

那么,在增加信息量、面对完全信息博弈时,我们是如何通过架构优化,把败率极限压缩到1%以内的?以下是本次迭代的核心“手术”记录。


1. 给“手”装上方向舵:从盲目发力到精准制导

在前一版的本体论中,我们设计的“挡”和“斜挡”堪称完美,但“爬”和“尖”却漏洞百出。

最尴尬的场景是:模型脑子(策略)明明算出最优解是横向延伸,但执行时“手脑不匹配”,硬生生下成了纵向爬。

解法:给动作空间增加“方向”维度。
我们将原本单一的落子函数,拆解为落子位置 + 方向 + 是否跳跃。通过增加一个专门预测“八个方向”的Output Token,彻底解决了手脑不匹配的问题,大幅提升了复杂棋形下动作执行的稳定性。

2. 给“眼”升级分辨率:借用Linux权限编码,一眼看穿“跳”的伪装

之前的“观察(眼)”模块,只能识别()XX_()这种连续状态(两头空0%,一头堵50%,两头死100%)。这种粗粒度的观察,根本无法识别()X_X()这种中间断开的“跳”形。

解法:引入类似Linux文件权限的3位二进制编码。
我们将棋形状态拆解为三个维度:H(Head/头) M(Middle/中) E(End/尾)。

  • 对于()X_X()这种跳形,中间位置M的值为1。
  • 通过这种3位编码,我们可以用0~7 这8个数字,完美压缩并表达所有可能的棋形状态。

这不仅让“眼睛”看得更真、更细,还保持了输入Token的极度精简。

3. 给“反射弧”打上硬补丁:用If-Else驯服概率模型的“不确定性”

神经网络本质上是概率模型,它不懂绝对的“AI逻辑”,因此在极端防守时偶尔会“抽风”。前文我们提到用“过程奖励”来训练反射弧,但这次我们上了更直接的“硬手段”。

解法:在神经网络层植入“If-Else”安全气囊。
既然代码是确定的,我们就在特定信号触发时,直接通过if-else强制返回指定结果。更关键的是,在反向传播时,对于这种强制干预的情况,直接赋予一个“负无穷(-∞)”的反馈权重。

这相当于给模型的反射弧打上了一个不可磨灭的钢印:只要看到这种致命威胁,不需要概率计算,直接触发绝对防御。

4. 引入JEPA架构:像果蝇一样,在脑海中“预演”未来

这是本次迭代最核心、也最优雅的改进。

前文我们提到了“反射弧”,但如何让反射弧具备前瞻性?我们借鉴了神奇的大自然——以最近大火的“赛博果蝇”为例,果蝇的视觉神经结构极其稳定,却能应对极其复杂的飞行场景。

在Qwen的建议下,我们引入了Yann LeCun力推的JEPA(联合嵌入预测架构)思想:

  • 模型对当前状态的观察是S。
  • 我们让模型在隐空间中去预测S+1以及S+2的状态。
  • 魔法发生了:当敌方即将形成“双三”绝杀时,这个致命威胁会作为信号,从S+2提前反馈到当前的S中。

通过这种“预演未来”的机制,模型在观察当前棋盘时,就已经“看”到了两步之后的杀机。为此,我们甚至移除了对 S+1 相关预测的冗余代码,让算力全部集中在对 S+2 致命威胁的感知上。

这不再是简单的“见招拆招”,而是真正的“防患于未然”。


结语:在Scaling Law的狂欢中,保持对“架构”的敬畏

从3x3到15x15的降维打击,再到如今败率不足1%的极限逼近,这一系列实验反复向我们证明了一个道理:

在通往AGI的路上,暴力堆砌参数(Scaling Law)绝不是唯一的解药。

传统的15x15五子棋AI,可能需要数百万参数去拟合225个像素的空间关系。而我们的本体论架构,输入仅十几个Token,总参数量不到10万,却通过“精准的状态编码”、“手脑协同的动作空间”、“硬连线的反射弧”以及“预演未来的JEPA”,实现了令人惊叹的性能。

我们也许不需要那么多参数。我们需要的是教给模型一双看透本质的“眼睛”,一双精准执行的“手”,以及一个能在脑海中推演未来的“大脑”。

智能的涌现,往往不源于规模的盲目膨胀,而源于对世界运行规律(本体论)的极致抽象。这,或许才是Jev/Laya和这次实验带给我们最大的启示。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询