AIA Forecaster: Technical Report

https://arxiv.org/pdf/2511.07678v1

原创示意图:为什么更弱的 AI signal 仍然有组合价值

原创示意图:为什么更弱的 AI signal 仍然有组合价值

Intro

这篇很值得看,因为它和我现在在想的 Financial Benchmark + Point-in-time Market Memory 高度相关。

先讲结论:它不是 RSI 论文,也没有训练一个新的 forecasting model。本质上是 Bridgewater AIA Labs 用现成的 o3,叠加 agentic search、10 次独立采样、Supervisor 和统计校准,做出一个高性能的 inference-time forecasting system。

所以这篇真正证明的不是「LLM 已经能预测未来」,而是:

当信息基础设施、并行研究流程、分歧解决机制和概率校准都做好以后,现有模型已经可以在一部分结构化预测任务上接近顶尖人类。

但我觉得论文里商业价值最高的结果甚至不是 match superforecasters,而是:

AI 单独明显打不过强 prediction market,但 AI + Market 的组合反而能超过 Market。

这意味着一个信号不需要单独 outperform benchmark。只要它和 benchmark 的 error 不完全相关,就仍然可能有组合价值。

方案

paper-fig1-architecture.png

整套系统可以压缩成:

Question → 10 个独立 research agents → 各自动态搜索和预测 → Supervisor 找出分歧并追加搜索 → 输出概率 → Platt Scaling 校准

几个关键点:

1)Agentic Search 不是预先生成三条 query 就结束。每个 agent 会根据上一轮搜索结果,自己决定下一步还缺什么信息。

2)每道题默认跑 10 次独立预测,因为单次 LLM forecast 的方差很大,容易漏掉关键证据、锚定错误 base rate,或者随机生成一个很极端的观点。

3)Supervisor 不是简单投票,也不是从 10 个答案里挑一个「写得最好」的。它先定位各 agent 在事实、base rate 和推理上的 disagreement,再围绕 disagreement 追加搜索。

4)最后用 Platt Scaling 把概率往 0 或 1 推远,纠正 LLM 习惯性向 50% 收缩、过度保守的问题。