- 今年各类年度回顾陆续上线,OpenAI 前联合创始人 Andrej Karpathy 也发布了自己的大模型年度总结。
- 早些时候他在 YC 演讲引发热议,提出:软件进入 3.0(从写代码到喂数据,再到对模型用 Prompt “念咒语”)、LLM 像新的操作系统(调度上下文与推理算力)、AI Agent 的成熟需要十年(从 99% 可靠性到 99.999%)。
- 在《2025 年度总结》中,他继续拆解:这一年 AI 到底“长出了怎样的脑子”。
他认为 2025 是 LLM 强劲却充满变数的一年,出现了多项“范式转变”:
- RLVR 让 AI 在可自动验真任务(数学/代码)中通过对错反馈学会“更像推理的策略”,算力更多花在“想更久”而非“变更大”。
- 参差不齐的智能:AI 在少数领域尖刺式爆发,但在简单逻辑上仍可能犯低级错;基准测试也更容易被“应试训练”刷榜。
- Cursor 走红说明应用层更厚:有人负责“上下文工程”,有人在后台拆任务、调多模型、控成本,还提供“自主性滑块”。
- Claude Code 强调“本地化”:AI 住进你的电脑/CLI,更贴近真实环境(代码、配置、密钥、乱七八糟的依赖都在本地)。
- Vibe Coding:你表达意图与感觉,AI 生成代码;对普通人是门槛消失,对专家是代码变得廉价、一次性。
- 多模态 GUI:未来交互不该是吐一堆字,而是直接生成图表、网页、交互面板,把文本、推理、视觉表达揉在一起。
术语小抄(通俗解释)
- LLM:Large Language Model,大语言模型,能理解/生成文字(也可能多模态)。
- Context Window(上下文窗口):模型一次能“记住并参考”的信息长度,像临时工作记忆。
- SFT(监督微调):人给标准答案,模型学“应该怎么答”。
- RLHF(人类反馈强化学习):人给偏好打分,模型学“人更喜欢哪种答法”。
- RLVR(可验证奖励强化学习):用能自动判对错的任务训练(数学/代码),反馈更客观、规模更大。
- Agent(智能体):不只是回答问题,还能规划步骤、调用工具、反复执行直到完成任务的 AI。
- CLI(命令行):黑底白字的终端界面,用命令控制电脑;开发者常用。



