程序员进阶版
F 轨道 · 模型与训练基础(选修)
决策级加轻量动手级的模型内部知识,服务于 Agent 架构判断而不是从零训练大模型
定位:选修 · 语言:Python 为主 · 与主线的关系:通过服务接口对接 TypeScript 平台
为什么需要这条轨道
Senior / Staff 级别的架构决策,很多都建立在知道模型内部大致如何工作之上:为什么长上下文会中间遗忘、为什么同一 Prompt 换模型行为差异巨大、为什么某任务微调一个小模型比堆大模型更划算、为什么推理模型更慢更贵但更准。
这条轨道的边界
目标是决策级加轻量动手级,不是从零训练大模型。你不需要能复现 GPT,你需要能在架构评审上说清楚为什么选这个模型、为什么这个任务该微调而不是加 Prompt。
完成本轨道后,程序员基础版第 2 周的原生模型 API 会从「会调 API」升级为「理解自己在调什么」。已具备扎实 ML / DL 背景者可跳过 F1–F2,直接从 F3 开始。
每个模块的产出格式
一份 1 到 2 页原理笔记(用自己的话解释机制)+ 一个最小可运行实验(notebook 或脚本)+ 一条「这对 Agent 架构意味着什么」的结论。
第三项是这条轨道和普通 ML 教程的根本区别。学完一个机制说不出它对 Agent 架构的影响,就等于没学。
F1 · 数学与机器学习最小基础
可选,按需补齐。
- 目的:能读懂论文与调参,不追求推导深度
- 关键主题:线性代数(向量 / 矩阵 / 范数)、概率(分布 / 贝叶斯 / 极大似然)、梯度与梯度下降、过拟合 / 正则化、评估指标(准确率 / 精确率 / 召回率 / F1 / AUC)、训练 / 验证 / 测试划分
- 产物:用逻辑回归加一个真实数据集完成一次完整的训练、评估、调参闭环
- 对 Agent 的意义:理解数据分布、指标、过拟合,是后续微调与 Eval 的共同语言
F2 · 深度学习与 Transformer 机制
- 目的:能画出并解释 Transformer 的数据流
- 关键主题:神经网络与反向传播、词向量与 Embedding、注意力(Q/K/V)与多头注意力、位置编码、Transformer 编码器 / 解码器、tokenization(BPE / 子词,中英文差异)、上下文窗口的由来与代价、KV Cache
- 产物:从零实现一个极简注意力或单层 Transformer(可参照教程),并写清注意力为什么能建模长依赖、代价是什么
- 对 Agent 的意义:解释上下文窗口成本、长上下文中间遗忘、为什么 token 数直接等于钱与延迟
这个模块直接支撑程序员基础版第 5 周的上下文工程。学完之后你对 Chunk 尺寸和预算裁剪的判断会从经验变成原理。
F3 · 语言模型、主流架构与推理行为
- 目的:理解预训练到指令模型到推理模型的能力来源与差异
- 关键主题:GPT / LLaMA / Qwen 等主流架构差异;预训练与指令微调;base / instruct / reasoning 模型的区别;采样参数(temperature、top-p、重复惩罚);确定性与幻觉的来源;推理模型的机制、优势与成本;上下文工程与上下文腐化
- 产物:同一任务在 base / instruct / reasoning 三类模型加不同采样参数下的对比实验报告
- 对 Agent 的意义:这是主线模型选型、Prompt Registry、成本与延迟治理的理论底座
F4 · 微调与参数高效方法(PEFT)
- 目的:能判断该不该微调,并能动手用 LoRA 微调一个可用小模型
- 关键主题:指令数据集格式(Alpaca 指令跟随、ShareGPT 多轮);数据收集 / 清洗 / 去偏 / 均衡(下采样加大模型数据增强);PEFT / Prompt-Tuning / P-Tuning;LoRA / QLoRA;量化(int8 / int4);全参微调与 DeepSpeed 概念(了解即可);训练环境、超参、评估;模型合并、打包与 vLLM 高性能部署;何时微调对比 RAG 对比 Prompt 的决策矩阵
- 产物:用 LoRA / QLoRA 微调一个小模型(如
bert-base-chinese做层级分类,或一个小型 LLM 做抽取 / 改写),给出微调前后指标对比与成本 / 延迟对比,并用 vLLM 或等价方式部署为一个 HTTP 推理服务 - 对 Agent 的意义:直接对接 E1 微调服务,让 Agent OS 能挂载自训小模型
决策矩阵是这个模块最值钱的产出。面试里被问「什么时候该微调」,有矩阵和没矩阵的回答差距极大。
F5 · 对齐与偏好优化(RLHF / DPO)
- 目的:理解对齐三阶段与偏好优化,能判断何时需要对齐
- 关键主题:强化学习基础(MDP、策略梯度、Actor-Critic,了解即可);RLHF 三阶段(SFT → 奖励模型 → PPO);DPO / GRPO 与无需奖励模型的偏好优化;KL 惩罚 / GAE / PPO-Clip 等稳定性技巧的作用;对齐与安全 / 合规 / 风格控制的关系
- 产物:用 DPO(或最小 PPO)在一个小模型上做一次偏好对齐实验(如稳定输出正向或合规文案),并说明同样目标用 Prompt 或规则能否达成、边界在哪
- 对 Agent 的意义:为 附录 B 第 20 周的 Security 与 A9 的业务风格 / 合规控制提供模型层手段的判断力
F6 · 多模态基础
- 目的:理解图文理解与生成,能把多模态能力作为工具接入 Agent
- 关键主题:ViT 与图像表征;CLIP 与图文对齐(文搜图);VLM 图文理解;Diffusion / 条件扩散与文生图(ControlNet / LoRA / IP-Adapter 概念);多模态检索(图像向量化加近似最近邻,如 HNSW);多模态 RAG
- 产物:实现一个文搜图或图生文标题的最小闭环(可用 CLIP-Chinese 或现成 VLM),并封装为一个可被 Agent 调用的工具接口
- 对 Agent 的意义:直接对接 E3 多模态 Agent 与业务场景中的图文处理
面试考点
这条轨道对应面试里的模型层理解深度,在做模型应用或有自训需求的团队权重高,在纯应用团队是差异化项。
- 「你了解 Transformer 吗?」:不要背论文。答上下文窗口成本的由来、KV Cache 为什么能省钱、中文 tokenization 为什么比英文吃亏。从工程后果倒推原理,比复述架构图更能证明你真懂。
- 「什么时候该微调?」:拿 F4 的决策矩阵答,讲清微调对比 RAG 对比 Prompt 的判据:知识更新频率、任务确定性、数据量、成本模型。
- 「为什么这个模型比那个贵?」:答参数规模、推理模型的思考 token、上下文长度的平方级注意力成本。能算清一次 Agent Run 的成本构成,是很实在的加分。
- 「幻觉是怎么来的?」:答训练目标是接话不是查证,展开讲什么样的问题最容易触发。然后自然过渡到 RAG 和引用绑定这些工程手段。
- 注意分寸:如果岗位是 Agent 应用工程师,模型层聊两三分钟就够,要主动把话题带回工程。在应用岗上过度炫耀模型知识,反而会让面试官怀疑你的岗位匹配度。
复习与延伸
- Hugging Face Transformers
- PEFT(LoRA / QLoRA)
- TRL(SFT / DPO / PPO 对齐)
- vLLM 高性能推理部署
- The Illustrated Transformer
- LLaMA 模型卡 与 Qwen 模型卡
- CLIP
- Diffusers(文生图 / ControlNet / LoRA)
- microsoft/AI-For-Beginners:F1–F2 的内容与它的第 3 到 5 课、第 13 到 20 课高度重叠,需要系统补基础的话它的 notebook 可以直接用
下一步:E 模块 · 进阶扩展(选修)