2026年7月31日 · 9 分钟
Attention 真正换了什么:用 O(n²) 计算买下 O(1) 的路径
Transformer 的关键不是注意力更聪明,而是把信号传递路径压成常数。代价是 O(n²) 计算——这笔交易在 2017 年成立,到现在还没结清。
LLM Transformer Attention +1
精选
长期会反复翻看的方向,比时间线更能说明我在关心什么。
systems / workflow
eval / reliability
harness / process
paper / notes
build / ship
photo / daily
最新
技术文章、论文阅读、实验观察和工程思考会汇入同一个博客流。
Transformer 的关键不是注意力更聪明,而是把信号传递路径压成常数。代价是 O(n²) 计算——这笔交易在 2017 年成立,到现在还没结清。
GPT-3 的重点不是 1750 亿参数,而是把任务适应从微调阶段挪到了上下文中。
本文介绍 LLM 的基础知识,包括推理过程、Transformer 结构、KV Cache、模型类型和 VRAM 计算等核心概念。
精选
偏 GitHub repo 管理,先用手动维护保证每个项目都有清楚说明。
把日志诊断拆成分阶段 Agent 流程,并通过评测回看真实失败类型。