2026年8月4日 · 9 分钟
GPT-4 的 Predictable Scaling:怎么在烧钱之前知道模型上限
Predictable scaling 让大模型开发从盲目的算力竞赛变成了可预期的工程决策——用小模型外推大模型的上限。但 loss 可预测,不代表能力和校准性也可预测。
LLM GPT-4 Scaling Law +2
论文阅读、工程观察和 AI 工具实践的整理与分享。
Predictable scaling 让大模型开发从盲目的算力竞赛变成了可预期的工程决策——用小模型外推大模型的上限。但 loss 可预测,不代表能力和校准性也可预测。
Transformer 的关键不是注意力更聪明,而是把信号传递路径压成常数。代价是 O(n²) 计算——这笔交易在 2017 年成立,到现在还没结清。
GPT-3 的重点不是 1750 亿参数,而是把任务适应从微调阶段挪到了上下文中。
围绕 AI、Agent 和效率工具的项目实践。
把日志诊断拆成分阶段 Agent 流程,并通过评测回看真实失败类型。