2026年7月31日 · 8 分钟
GPT-3 真正改变了什么,任务适应从微调移到了上下文
GPT-3 的重点不是 1750 亿参数,而是把任务适应从微调阶段挪到了上下文中。
LLM GPT-3 In-context Learning +1
精选
长期会反复翻看的方向,比时间线更能说明我在关心什么。
systems / workflow
eval / reliability
harness / process
paper / notes
build / ship
photo / daily
最新
技术文章、论文阅读、实验观察和工程思考会汇入同一个博客流。
GPT-3 的重点不是 1750 亿参数,而是把任务适应从微调阶段挪到了上下文中。
本文介绍 LLM 的基础知识,包括推理过程、Transformer 结构、KV Cache、模型类型和 VRAM 计算等核心概念。
如果没有稳定的评测切面,很多 Agent 改动都会陷入看似变好、实际不可验证的状态。
精选
偏 GitHub repo 管理,先用手动维护保证每个项目都有清楚说明。
把日志诊断拆成分阶段 Agent 流程,并通过评测回看真实失败类型。