从预测智能到处方智能:销量预测科学的范式跃迁与理论重构(四)——决策兼容性、处方公平性与可审计智能的系统框架
2026/9/23 16:01:15 网站建设 项目流程
前序论文从决策兼容性、删失需求恢复、处方AI审计定位和基础模型选择性适应四个维度,论证了销量预测科学从“预测智能”向“处方智能”跃迁的理论基础。本文在既有框架上进一步深化,聚焦三个尚未被充分理论化的核心问题:预测系统与决策系统在目标函数上的数学等价性如何为“决策兼容性”提供严格基础、删失需求恢复如何从技术问题上升为处方公平性的制度要求、以及处方AI的可审计性如何从“可追溯”升级为“可辩护”。本文的核心理论贡献在于:论证校准分位数预测与最优报童解的数学等价性为决策兼容性提供了决策论基础,提出“预测—决策解耦原则”作为删失场景下处方系统设计的基本架构准则,并构建“可辩护性阶梯”框架以刻画处方AI审计能力的层级结构。本文进一步将这些理论命题置于工业部署的实践检验中,指出处方智能的落地面临的核心张力不在于算法能力,而在于决策权限的重新分配与问责链条的重构。

关键词:处方智能;决策兼容性;删失需求;处方公平性;可辩护性;预测-决策解耦

一、引言:从范式论证到系统构建

前序论文已系统论证了销量预测科学从“预测智能”向“处方智能”跃迁的必要性与方法论基础。决策兼容性原则要求预测系统的设计目标从“预测误差最小化”转向“作为决策输入的预测质量最优化”;删失需求恢复被论证为处方公平性的前提;处方AI被定位为审计人类决策的认知矫形器而非自动化决策的预言机。

然而,这些命题之间的内在关联尚未被充分理论化。决策兼容性的数学基础是什么?删失需求恢复在处方系统架构中应当处于什么位置?可审计性从“可追溯”到“可辩护”的升级需要什么样的制度与技术支撑?本文将从三个维度深化这一讨论,并在此基础上构建一个整合性的系统框架。

二、决策兼容性的数学基础:校准分位数与最优报童解的等价性

2.1 核心定理及其含义

决策兼容性作为预测系统设计的首要原则,其数学基础在2026年取得了关键突破。Ngartera等提出的决策智能框架建立了一个核心定理:经过校准的分位数预测在数学上等价于最优报童解。这一定理的形式化表述可以概括为:在报童问题的标准假设下,给定需求分布F和成本结构(缺货成本p_s,积压成本w),最优订货量Q满足F(Q) = p_s/(p_s + w)。如果预测系统输出的分位数τ = p_s/(p_s + w)经过校准,即预测的τ分位数与真实分布的τ分位数一致,则该预测直接映射为最优订货量,无需通过额外的优化步骤。

这一等价性的实践含义是深远的。它意味着预测系统的输出不应是单一的点预测,而应是面向决策优化的分位数组合。实证结果验证了这一框架的价值:在UCI在线零售数据集上,相对于基于中位数(P50)的策略,P90策略在经验残差自举下将尾部风险(CVaR 95)降低26.7%,将周期服务水平从44.4%提升至89.5%,并将平均成本降低48.7%。对数正态压力测试显示更大的降低幅度(72.3%)。

2.2 从等价性到设计原则

上述定理为决策兼容性作为设计原则提供了严格的决策论基础。其核心推论是:预测系统的精度评价指标应当与其所服务的决策目标函数对齐。如果决策目标是最小化库存成本,那么预测系统的优化目标应当是分位数损失(Quantile Loss)而非均方误差(MSE)。一项关于成本敏感需求预测的研究证实了这一推论:将预测损失与库存成本不对称性对齐,即使统计精度相当,也能增强经济表现——“在平方误差意义上准确的预测仍然可能导致糟糕的订货决策”。

这一发现与基础模型的评估结果形成了深层呼应。系统综述和元分析发现,基础模型在Scaled Quantile Loss上的优势(Δ = -0.318, p < .0001)显著大于在WAPE上的优势(Δ = -0.116, p = 0.018)。这意味着基础模型的核心价值不在于“预测得更准”,而在于“预测得更全面”——更好地捕捉需求的概率分布、尾部风险和不确定性区间。对于库存管理而言,决策者需要的不仅是“下周大概卖多少”,更是“下周卖不超过X件的概率是多少”,这正是分布预测的核心优势。

2.3 决策兼容性的操作化

决策兼容性可以从三个维度进行操作化定义。误差方向性兼容要求预测系统根据决策成本结构选择最优的分位数策略,而非追求无偏的点预测。在库存决策中,低估导致的缺货成本与高估导致的积压成本是不对称的,预测系统应当能够根据这一不对称性调整其输出。分布特征兼容要求预测系统输出关于需求分布尾部行为的准确信息。基础模型在分布指标上的优势与风险敏感决策的需求完美匹配。响应模式兼容要求预测系统在分布偏移时保持鲁棒性,而非仅在平稳条件下表现优异。

这三个维度的共同指向是:决策兼容性不是预测精度的对立面,而是对预测质量的重新定义。一个决策兼容的预测系统可能在某些传统精度指标上表现不如纯精度优化的系统,但它在决策效果上更优。这正是决策感知评估框架的核心发现——预测精度排名与订单服务水平排名在工业面板上呈负相关(r = -0.555)的理论根源。

三、删失需求恢复与处方公平性:从技术问题到制度要求

3.1 删失需求的技术本质

删失需求是零售预测中最棘手的问题之一。当商品缺货时,观测到的销售数据被“删失”——那些本应发生的销售从未出现在数据中。传统预测模型将观测销量视为需求真值进行训练,由此产生的系统性低估在库存决策中被进一步放大:模型学到的是“该商品卖得少”,而非“该商品因缺货而未能卖出”。

Tobit ETS将指数平滑模型扩展到删失观测场景,利用ETS分类法构建了一个能够有效处理删失数据的统计框架,在来自供应链行业和预测竞赛的真实与模拟数据集上展示了预测偏差的显著降低。更具系统性的进展来自FreshRetailNet-50K基准的建立,该基准包含带缺货标签的小时级中国生鲜零售数据,配套了泄漏-free的删失需求恢复与库存优化流水线。

3.2 预测-决策解耦原则

FreshRetailNet-50K的研究揭示了一个关键的方法论区分:一个被训练用于估计潜在需求的模型,不应被以删失销量为基准进行评分——基准指标和库存决策需要两个不同的头。这一发现的方法论含义超越了技术层面,指向一个更一般的架构原则:预测-决策解耦原则。

该原则要求处方智能系统在架构上将预测层与决策层分离。预测层的目标是恢复潜在需求的无偏估计,其评价标准是偏差控制和稳定性;决策层的目标是最小化运营成本,其评价标准是服务水平、库存周转和尾部风险。两层共享底层特征和表示学习,但在输出层和优化目标上根据各自的功能定位进行分化。

FreshRetailNet-50K的研究进一步证实了这一原则的实践必要性。在库存层,偏误控制比预测精度更为关键——全特征集的价值在于提供偏误控制和稳定性,而非提升头寸WAPE。这一发现与特征简约性分析的结果一致:手工精选的16特征最小配置在WAPE上与完整的117特征集几乎持平(34.03% vs 34.01%),但在偏差上付出了显著代价(-9.59% vs -6.43%)。这意味着,完整特征集的核心价值不在于提升预测精度,而在于控制系统性偏差,而后者才是库存决策真正敏感的因素。

3.3 处方公平性的制度含义

删失需求恢复不仅是一个技术问题,更是一个处方公平性问题。当处方智能系统忽略缺货导致的低销售信号时,它将系统性地惩罚那些实际需求旺盛但因库存不足而销售受限的商品。这种惩罚在品类层面可能产生结构性偏差:高周转、易缺货的商品被系统性地低估需求,而低周转、不易缺货的商品则得到相对准确的预测。

从制度层面看,处方公平性要求处方智能系统在以下三个方面建立机制。第一,删失感知的训练与评估:采用可用性掩码使缺货日不参与损失计算、间歇性统计和精度指标。第二,偏差方向的透明度:系统不仅需要输出需求预测,还需要输出对该预测是否受到删失影响的置信度评估,使决策者能够在置信度低时采取更保守的决策或触发人工审查。第三,品类公平性审计:定期评估系统在不同品类上的预测偏差分布,识别是否存在系统性的品类歧视。

Stockout-Aware Segmentation and Model Routing的研究进一步表明,删失感知不仅应体现在训练阶段,还应体现在模型路由层面。不同品类的缺货模式、间歇性程度和促销敏感性存在显著差异,处方智能系统需要根据这些特征动态选择恰当的预测模型和恢复策略,而非用统一的流水线处理所有SKU。

四、从可追溯性到可辩护性:处方AI审计能力的层级结构

4.1 模仿不完整性定理与规范信号的必要性

处方AI从“建议”走向“执行”时,可问责性问题变得日益紧迫。Farias将处方AI正式化为一种独立的人机决策协作范式,其核心功能是审计人类在不确定性下的决策,而非自动化决策。研究引入了一组领域无关的公理来刻画处方系统,并证明了模仿不完整性定理:从历史决策中进行监督学习,在缺乏外部规范信号的情况下无法纠正系统性偏差。在标准正则条件下,归纳出的预测器几乎必然收敛到有偏的行动,而非规范最优的行动。

这一定理对销量预测的处方化具有直接指导意义。如果一个补货系统仅从历史补货决策中学习,它将复制而非纠正采购员可能的系统性偏差。研究进一步证明的规范不可识别性定理强化了这一结论:理性选择背后的效用函数在系统性偏差下无法从行为数据中恢复,且这种失败在估计方向上具有方向性,不同于经典逆向强化学习的对称奖励模糊性。

这意味着,处方AI必须引入独立于历史决策的规范性信号,这些信号可以来自因果推断的结果、优化模型的解、或领域专家的规则。处方AI的角色不是预测人类会做什么,而是审计人类应当做什么。

4.2 可辩护性阶梯框架

在系统实现层面,Azarang的研究揭示了当前AI交付管道的可验证性鸿沟:在所调查的47个交付平台中,没有一个平台的默认记录能够发出行为元组的内容寻址身份。这一发现对处方智能系统的设计具有直接警示意义。审计追踪的核心要求不仅是可追溯性(记录了什么数据、应用了什么逻辑),更是可辩护性——在给定的输入和约束下,系统能够证明其建议是最优的或至少是合理的。

本文提出可辩护性阶梯框架来刻画处方AI审计能力的层级结构。第一层是记录层:系统能够记录决策的输入、输出和上下文。这是当前大多数系统所达到的水平。第二层是解释层:系统能够解释为什么在给定输入下生成了特定建议。这一层依赖于可解释AI技术和因果推断结果。第三层是比较层:系统能够证明在给定的约束条件下,其建议优于或等于所有可行的替代方案。这要求系统维护一个可行行动空间并能够对其进行评估。第四层是规范层:系统能够证明其建议符合独立于历史决策的规范性标准(如优化最优性、因果合理性、领域规则一致性)。这是处方AI审计能力的最高层级,也是模仿不完整性定理所要求的规范信号发挥作用的地方。

4.3 决策记忆与可审计的智能体架构

可审计的智能体决策框架正在形成。AEGIS-Chain框架展示了自主处理78.4%的常规决策、同时将重要情况升级给人工审查、并在所有运营周期中保持完整不可变决策追踪的架构可行性。更关键的是决策记忆的概念:系统不仅记录决策的结果,还记录决策时的输入状态、考虑的替代方案和选择的理由。

在销量预测的处方化场景中,决策记忆的具体形式是:当系统建议加速一个订单、取消一次采购或调整一个价格时,相关的审计追踪应当记录预测输入、因果推断结果、优化模型的解、最终建议的置信度评估,以及在生成建议时所使用的规范性信号。没有规范性信号的审计追踪,即使技术上是完整的,也无法回答“为什么这个建议是正确的”这一根本问题。

五、整合框架:处方智能系统的四层架构

综合上述分析,本文提出处方智能系统的四层架构,将前序论文和本文的理论命题整合为统一的设计框架。

第一层:需求恢复层。 该层的核心功能是从删失观测中恢复潜在需求的无偏估计。关键设计原则包括:删失感知的训练与评估、特征简约性与偏差控制的平衡、以及基于品类特征的模型路由。

第二层:概率预测层。 该层的核心功能是输出面向决策优化的分位数组合,而非单一的点预测。关键设计原则包括:校准分位数与最优报童解的等价性、分布尾部行为的准确刻画、以及跨层级概率对账的一致性保持。

第三层:处方生成层。 该层的核心功能是基于概率预测和规范性信号生成可操作的决策建议。关键设计原则包括:规范性信号的引入(因果推断结果、优化模型的解、领域规则)、决策层级的架构对齐、以及“不行动”作为一等输出的纳入。

第四层:审计与可问责层。 该层的核心功能是记录、解释和辩护处方建议。关键设计原则包括:可辩护性阶梯的四层能力、决策记忆的完整记录、以及人工升级机制的建立。

这四层架构的核心创新在于预测-决策解耦与规范信号注入的协同设计。第一层和第二层构成预测模块,其评价标准是偏差控制和分布校准;第三层和第四层构成处方模块,其评价标准是决策效果和可辩护性。两层之间通过规范信号连接——预测模块输出的是关于需求状态的信息,处方模块基于这些信息和独立于历史决策的规范性标准生成建议。

六、工业部署的实践检验

6.1 Decathlon的Chronos-2部署

Decathlon在生产环境中部署Chronos-2的案例提供了处方智能系统在真实零售环境中最有说服力的验证。经过LoRA微调的Chronos-2在12周预测周期上相对于DeepAR、Holt-Winters和TFT实现了11—15个百分点的WAPE降低。在覆盖101个滚动截断点、25,000个产品的严格基准测试中,模型选择在生产部署前得到了验证。每个WAPE改进百分点转化为0.3天的库存节省、0.3个百分点的可用性提升和0.12个百分点的销售增长。推理运行时间从10—15分钟缩短至40—75秒,部署时间从每个区域的6个月缩短至2—3个月。

6.2 Sam’s Club可解释预测智能体

Sam’s Club门店经理可解释预测智能体的部署展示了处方智能在决策支持层面的实践效果。该系统使用388行、106个特征的数据集,比较原始预测、朴素预测、Prophet和XGBoost四种候选预测,为每个SKU-日选择最佳预测。通过Streamlit应用的五标签界面呈现证据,本地Llama 3.2模型通过Ollama和LangChain编排,基于FAISS向量存储的历史异常摘要提供自然语言解释。

其运营效果是可量化的:在建模子集(n=121 SKU-日)上,系统将实际销售保持在预测区间内的比例为97.5%,识别出19.8%的天数存在过度或不足预测,如果门店经理遵循选定模型的建议,原预测造成的1,508美元销售损失被转化为4,949美元的盈余。这一案例表明,处方智能的价值不在于替代人类的判断,而在于将不透明的预测数字转化为可审计、可操作的证据,使非技术性的门店操作者能够做出更好的决策。

6.3 实践检验的核心发现

这些部署案例共同揭示了一个核心发现:处方智能落地的瓶颈不在于算法能力,而在于决策权限的重新分配与问责链条的重构。Decathlon的案例展示了当预测系统从“精度工具”转变为“决策组件”时,部署时间可以大幅缩短。Sam’s Club的案例展示了当系统从“黑箱预测”转变为“可解释证据”时,非技术性操作者能够有效地利用AI输出改进决策。

然而,这两个案例都处于可辩护性阶梯的“解释层”而非“规范层”。系统的建议虽然可以被解释和追溯,但尚不能证明其在规范性意义上的最优性。从解释层向规范层的跃迁,是处方智能从“决策支持”走向“决策审计”的关键一步。

七、结论:处方智能的三个理论支柱

本文在前序论文的基础上,进一步深化了销量预测科学从预测智能向处方智能范式跃迁的理论基础。本文的核心贡献在于构建了处方智能的三个理论支柱。

支柱一:决策兼容性的数学基础。 校准分位数预测与最优报童解的数学等价性为决策兼容性提供了严格的决策论基础。预测系统的输出应当是面向决策优化的分位数组合,而非单一的点预测。成本敏感预测的研究进一步证实,将预测损失与库存成本不对称性对齐可以增强经济表现,即使统计精度相当。

支柱二:处方公平性的架构要求。 预测-决策解耦原则要求处方智能系统在架构上将预测层与决策层分离。预测层的目标是恢复潜在需求的无偏估计,其评价标准是偏差控制和稳定性;决策层的目标是最小化运营成本,其评价标准是服务水平、库存周转和尾部风险。删失感知应当贯穿训练、评估和模型路由的全流程。

支柱三:可辩护性的层级结构。 模仿不完整性定理揭示了从历史决策中学习的结构性局限,要求处方AI引入独立于历史决策的规范性信号。可辩护性阶梯框架刻画了从记录层到规范层的四层审计能力,而当前系统大多停留在解释层。

这三个支柱共同指向一个根本性结论:处方智能的实现需要预测系统与决策系统在目标函数、评价体系和架构设计上的深度融合,而非简单的功能叠加。这一融合的成功不仅取决于算法和模型的进步,更取决于我们是否能够重新审视预测在决策链条中的角色——预测不是终点,而是行动的起点;精度不是目的,而是手段;而智能的本质,不在于知道会发生什么,而在于知道在不确定性中应当做什么,并能够为自己的建议承担责任。

当预测系统能够理解因果关系、适应决策情境、审计决策偏差、并在不确定性中提供可辩护的行动建议时,它才真正完成了从“预测科学”到“决策科学”的跨越。

参考文献

[1] Ngartera L, Nadarajah S, Koina R, et al. Stochastic Inventory Optimization with Coherent Risk Measures: A Decision-Theoretic Framework for Probabilistic Forecasting and Constrained Optimization[J]. Journal of Risk and Financial Management, 2026, 19(3): 173.

[2] Farias P P. Prescriptive Artificial Intelligence: A Formal Paradigm for Auditing Human Decisions Under Uncertainty[J]. arXiv:2512.04480, 2025.

[3] Pedregal D J, Trapero J R, Holgado E. Using Tobit exponential smoothing to enhance demand planning in the presence of censored data[J]. International Journal of Production Research, 2026, 64(11): 4297-4309.

[4] A Reproducible, Leakage-Free Pipeline for Censored Demand Forecasting and Inventory Optimization on FreshRetailNet-50K[J]. MDPI, 2026.

[5] Rubczynski M. When Do Foundation Models Pay Off for Retail Demand Forecasting? A Systematic Review and Cross-Benchmark Meta-Analysis[J]. Zenodo, 2026.

[6] Lebedev D O, Romanov A A. Stockout-Aware Segmentation and Model Routing for Daily Store-SKU Demand Forecasting[C]. SmartIndustryCon 2026.

[7] Azarang R. From Traceability to Justifiability: Accountability Structures in Agentic Software Engineering[J]. arXiv:2608.23610, 2026.

[8] Chinnaraju A, Loganathan K A. Trustworthy Agentic Supply Chains: A Governance Framework for Digital Twin Orchestrated AI Decisioning Under Compliance, Auditability, and Data Sovereignty Constraints[J]. International Journal of Latest Technology in Engineering Management & Applied Science, 2026.

[9] Laurie J M. Explainable Sales Forecasting via an AI Agent: Question-Answering Support for Sam’s Club Store Managers[D]. University of Arkansas, 2026.

[10] Mitigating AOG Risks: An Asymmetric Demand Forecasting Paradigm for Critical Aircraft Components[C]. ACM, 2026.

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询