2026年8月4日 · 9 分钟
GPT-4 的 Predictable Scaling:怎么在烧钱之前知道模型上限
Predictable scaling 让大模型开发从盲目的算力竞赛变成了可预期的工程决策——用小模型外推大模型的上限。但 loss 可预测,不代表能力和校准性也可预测。
LLM GPT-4 Scaling Law +2
围绕 Agent、LLM 系统、论文阅读、工程实践和设计思考的长期写作。
Predictable scaling 让大模型开发从盲目的算力竞赛变成了可预期的工程决策——用小模型外推大模型的上限。但 loss 可预测,不代表能力和校准性也可预测。
Transformer 的关键不是注意力更聪明,而是把信号传递路径压成常数。代价是 O(n²) 计算——这笔交易在 2017 年成立,到现在还没结清。
GPT-3 的重点不是 1750 亿参数,而是把任务适应从微调阶段挪到了上下文中。