GPT-4 的 Predictable Scaling:怎么在烧钱之前知道模型上限
Predictable scaling 让大模型开发从盲目的算力竞赛变成了可预期的工程决策——用小模型外推大模型的上限。但 loss 可预测,不代表能力和校准性也可预测。
我是 Sikm,一名 AI 方向研究生。这里长期记录关于 Agent、LLM 与工程实践的笔记,偶尔也会写点生活。
博客笔记
更多 →Predictable scaling 让大模型开发从盲目的算力竞赛变成了可预期的工程决策——用小模型外推大模型的上限。但 loss 可预测,不代表能力和校准性也可预测。
Transformer 的关键不是注意力更聪明,而是把信号传递路径压成常数。代价是 O(n²) 计算——这笔交易在 2017 年成立,到现在还没结清。
GPT-3 的重点不是 1750 亿参数,而是把任务适应从微调阶段挪到了上下文中。
项目小集
更多 →围绕内容、双语和静态部署,搭建一个能长期维护的个人研究主页。
把日志诊断拆成分阶段 Agent 流程,并通过评测回看真实失败类型。
生活切片
更多 →不是效率技巧,而是一种避免长期项目失焦的简单节律。