深入理解 AI Agent · 14 天
每天 9:00 发布一页,20:00 验收。点开任意一天就能读,手机端已适配。
已发布 12 天
正在加载目录…
(当前浏览器没有运行 JavaScript,下面是静态目录)
Day 1
AI Agent 到底是什么
Agent 是闭环不是开环;大脑/眼睛/手脚与故障诊断表;观察空间与动作空间;变强的三条路(便签/工具箱/回炉);Harness 五格自查;工作流 vs 自主。
2026-09-22
Day 2
上下文工程(上):KV Cache、提示词与提示注入
上下文决定能力上限;API 四角色与无状态的核心循环;静态前缀+轨迹;KV Cache 三条铁律与五种错误模式;系统提示词的流程驱动写法;提示注入红队测试。
2026-09-23
Day 3
上下文工程(下):Agent Skills、状态栏与上下文压缩
按需加载 Skills、提炼状态栏、做减法压缩、隔离子 Agent:让长任务不迷路也不爆窗
2026-09-24
Day 4
用户记忆与知识库:让 Agent 记住你,也记住领域
记忆三问(放哪里/怎么存/存什么);RAG 流水线:分块-稠密-稀疏-融合-重排;索引期提炼与双层记忆架构
2026-09-25
Day 5
工具:让 Agent 从「会说」到「能做」
五类工具地图;专用工具 vs Skill 的四个决策维度;工具描述与参数保真;工具太多的三层解法;MCP 与 Skill Hub 的信任成本;执行工具四道闸(含 venv 不是沙盒)。
2026-09-26
Day 6
Coding Agent 与通用 Agent:代码为什么是「元能力」
通用 Agent 的骨架是「会写代码的 Agent 加一个文件系统」:七个核心工具、六步工作流程、Harness 四件套、四层故障恢复,以及代码作为元能力的六个方向
2026-09-27
Day 7
交互的时机与模态:异步、语音、Computer Use 与第 1 周实战
回合制只是接口约定不是环境性质;事件循环与安全点、取消/排队/并行三策略;语音三范式与快慢分离;Computer Use 三条定位路线与生态壁垒;第 1 周 mini harness 清单。
2026-09-28
Day 8
评估(上):怎么知道 Agent 真的变好了
Pass@k 看天花板、Pass^k 看底线;评估环境五要素;数据集与验证器;Rubric 四准则与 LLM 当裁判的三个坑。
2026-09-29
Day 9
评估(下):从分数到改进
失败归因要找首个错误;端到端与轨迹前缀两类回归任务;延迟、成本与行为策略三条选型线;统计显著性与配对分析;看到分数下降先查评测系统;可观测性与内部评估五件套;仿真环境与 RLVR 的结合。
2026-09-30
Day 10
模型后训练(上):什么时候该训模型,SFT 与 RL 差在哪
四阶段地图:预训练、中期训练、SFT、强化学习各在做什么;SFT 与预训练其实是同一个任务,唯一差别是 loss masking 这一层;用 GeneralPoints 实验讲清 SFT 记忆与 RL 泛化;GRPO 四步、PPO 与 DPO 对比;pass@k 判据和「先排除不用改权重的方案」的决策表。
2026-10-01
Day 11
模型后训练(下):环境、奖励与样本效率
RL 的瓶颈从不在算法:仿真环境保真度决定上限;多轮的核心是信用分配,环境返回的 token 不该学;奖励设计三个维度与「奖励结果、惩罚路径」;在轨蒸馏把一条轨迹变成密集监督;失败案例到训练数据的三个真实剧本。
2026-10-02
Day 12
Agent 的持续进化:从「做过一万次」到「下次更好」
保存经历不等于从经历中学习;三层验证器(结果/过程/质量)产出带证据的诊断;四种更新载体(知识/Skill/程序/参数)按能力形状选;在线记录+离线进化的双循环与分层指标;三道安全隔离。
2026-10-03