discipline/literature/scans/round-01.md
📑 本页目录
Round 1 · 学术进展扫描(快照 2026-08-10)
目的:为学科奠基提供外部证据地图。检索时间 2026-08-10;来源:学术数据库与网络检索; 详细条目见 ../index.md。证据等级沿用 S/M/W/X。
0. 扫描方法
- 检索主题:demand forecasting 综述、M4/M5 竞赛、时序基础模型、LLM 预测、概率预测、 conformal 时序、层级调和、判断预测、预测市场、nowcasting、间歇需求、AI 需求(GPU/token)。
- 纳入标准:有公开出处、对 DSF 七支柱或 AI 时代命题有直接启示。
- 局限:本扫描是框架性快照,非系统性综述(PRISMA 式系统综述留待后续轮次)。
1. 测量与需求统计(支柱 1)
- 截断是需求测量的常态:Tobit(L-A-01)与生存分析(L-A-02)是处理右截断/受限 观测的成熟框架;最新工作把截断与空间/图扩散结合(扩散感知截断 GP,L-A-05), 对「缺货转移」类需求有直接借鉴。
- 计数分布的选择影响结论:Kolassa(L-A-04)证明零售需求用 Poisson 会系统性 低估尾部,NB/更灵活分布更合适 —— 对应 RQ-A3(分布刻画)。
- LLM 合成数据的锚定问题:Agentic Economic Modeling(L-A-06)用 LLM 生成选择 + 小样本真实观测锚定,估计需求弹性与处理效应;这为「结构化生成」信号(02 §4 第 6 类) 提供了方法论雏形,但证据仍属 X→M。
2. 时间序列与计量(支柱 2)
- 经典体系仍是最强基线:ETS/ARIMA(L-TS-01/02)、M3(L-TS-03)证明简单稳健方法 在小样本上的价值;间歇需求必须用专门方法(Croston/SBA,L-TS-04/05)。
- nowcasting 成熟化:宏观层面 MIDAS/Google Trends(L-TS-07、L-TS-09)证明数字信号 可提升当前状态估计 —— DSF 把同样思路推广到商品/服务需求(RQ-A1)。
- 扩散模型:Bass(L-TS-08)是新产品需求预测的经典;AI 能力跃迁下的扩散参数 变化是开放问题(RQ-B2)。
3. 机器学习与现代预测(支柱 3)
- M4/M5 的共识:M4 中纯 ML 未单点超越统计、组合获胜(L-E-03);M5 中 ML 首次整体胜出,关键在外部协变量与异质性(L-E-04)。结论:方法优劣依赖数据情境, 必须用评估协议裁决,不能靠阵营信仰。
- 时序基础模型:Chronos(L-ML-04)、TimesFM(L-ML-05)、Moirai(L-ML-06)在 零样本/少样本上逼近或超越局部训练模型;但公开评估显示增益不稳定、随数据集与 horizon 变化 —— 对应 RQ-D2(增益何时存在)。
- LLM 时序推理:TSAIA(L-ML-11)与综述(L-ML-10)显示 LLM 在多步推理、 workflow 组装上仍弱;Time-LLM(L-ML-09)的「重编程」路线在部分基准有效。 结论:LLM 当前更适合做「判断层」而非「数值引擎」。
4. 概率预测与不确定性(支柱 4)
- 范式已确立:概率预测 + proper scoring(L-P-01/02/03)是领域标准; 点预测是分布的特例。DSF 默认交付分布。
- Conformal 是工程化入口:split/adaptive/时序版本(L-P-04~08)提供模型无关、 有覆盖保证的区间;变点下的 conformal(L-P-09)是 2025 年活跃方向, 直接服务 RQ-C2(校准维护)。
5. 判断预测与群体智慧(支柱 5)
- 无辅助直觉被证据否决:结构化类比(L-J-02)、Delphi(L-J-03)、超级预测者 (L-J-04)都建立在「结构化判断优于直觉」之上;判断性调整(L-J-08)证明 未加纪律的调整会损害预测。
- 预测市场有情境边界:选举/经济上长期表现好(L-J-05/06);但传染病预测中 不如朴素基线(L-J-12),Polymarket 声称的准确率被独立检验打折(L-J-11)。 结论:市场是组合成员,不是万能答案(对应 RQ-D1)。
6. 层次与组合(支柱 6)
- 组合 = 免费午餐:50 年综述(L-H-03)与 M 系列一致支持;组合的收益递减 与权重动态化是开放工程问题(RQ-D1)。
- 层级调和成熟:MinT(L-H-05)与调和综述(L-H-06)提供跨粒度一致性方法; DSF 把需求层次(SKU→品类→市场)作为默认结构(公理 A3)。
7. 评估(支柱 7)
- 指标纪律:MASE(L-E-01)、DM 检验(L-E-02)、proper scoring 体系完备; M 系列(L-E-03/04/05)提供公共基准传统 —— DSF 应建立自己的基准(DSF-Bench,Round 3)。
- 大综述:Petropoulos et al.(L-E-06)是方法论全景图,可作为 DSF 方法库的 索引来源。
8. AI 时代(04-ai-era.md 的证据底座)
- LLM 预测能力:GPT-4 预测器接近人类预测人群(L-AI-01);LLM 辅助提升人类 预测 24-28%(L-AI-03)。人机混合预测是可工程化的现实(RQ-D3)。
- AI 需求实证:企业 GPU 需求预测成为系统研究主题(L-ML-12/13); token 消耗任务内 30 倍波动(微软研究院 2025,行业证据)。
- AI 采纳需求测量:NBER/Census 微观结构研究(L-AI-04)与 OECD 部门分类学 (L-AI-05)提供「AI 变革需求」的官方统计代理 —— 与 Case 0(ADDO)直接相关。
9. 关键共识与开放争论
共识(可直接写入学科框架) 1. 分布预测 + proper scoring 是标准(L-P-01/02)。 2. 组合优于单模型,判断需结构化(L-H-03、L-J-02)。 3. 方法优劣依赖情境,必须用样本外评估裁决(L-E-03/04)。 4. 截断/计数分布选择显著影响需求结论(L-A-01/04)。
开放争论(留给 RQ) 1. 时序基础模型是否全面超越强统计基线?(RQ-D2) 2. LLM 在预测中做「判断层」还是「数值引擎」?(RQ-D3) 3. 预测市场的增益在哪些情境成立?(RQ-D1) 4. 预测本身多大程度改变 AI 需求?(RQ-B3)
10. 对学科构建的三点启示
- 测量先行:学术共识里最容易立刻落地的是测量纪律(代理登记 + 截断建模), 建议 Round 2 先做。
- 评估为本:所有方法争论的裁决标准统一为评估协议(06-evidence.md), 避免「ML vs 统计」式无意义争论。
- AI 是对象也是方法:AI 同时改变需求对象、信号与方法;学科框架必须 把三者分开建模(04-ai-era.md 的结构),不能混为一谈。