程序员进阶版
E 模块 · 进阶扩展(选修)
微调服务、模型路由与成本优化、多模态 Agent、Text-to-SQL,把模型层能力真正接入 Agent OS
定位:选修 · 前置:E1 与 E3 建议先完成 F 轨道对应模块
这些模块把模型层能力真正接入 Agent OS,是从会用别人模型的 Agent 工程师走向能定制模型、控成本、做多模态与结构化数据的 Staff 的关键。每个模块产物同样遵循代码、测试、文档、演示四类。
哪个最值得先做
如果只选一个,做 E4(Text-to-SQL)。它是企业里最高频的 Agent 需求,面试出现率远高于其他三个,而且不依赖 GPU 资源就能完整做完。E2 次之,因为成本治理是任何团队都在意的。
E1 · 模型定制与微调服务
学习目标
让 Agent OS 支持挂载自训 / 微调模型,并把何时微调变成可复用的平台能力。
课程内容
- 微调对比 RAG 对比 Prompt 的决策矩阵
- 训练数据来源与治理(线上 Trace 转数据集、数据均衡、大模型数据增强)
- LoRA / QLoRA 训练流水线
- 训练任务的队列化与 GPU 资源管理
- 模型注册、版本与血缘(数据集 → 训练 → 权重 → 评估)
- 微调模型的离线评估与基线大模型对比
- vLLM / 量化部署与 Model Gateway 接入
- 微调模型的灰度、回滚与成本核算
实施任务
- 用 F4 产出的 LoRA 小模型(分类 / 抽取)在 Agent OS 中注册为一个 Provider
- 通过 Model Gateway 让某个工具或节点使用该微调模型
- 记录该任务从大模型切到微调小模型的准确率、延迟、成本三方对比
验收标准
- 微调模型可被 Agent Definition 按版本选用
- 每个微调模型可追溯训练数据集与评估结果
- 有明确的何时该微调、何时不该微调的判据文档
- 微调模型上线走同一套 Eval Gate
面试考点
- 「你们自己训过模型吗?」:答训过什么规模、解决什么问题、省了多少成本。重点讲三方对比数据,不要讲训练过程细节。
- 「线上数据能拿去训练吗?」:这题有合规陷阱。答要看授权范围和数据分类,引到 A9 的数据权利。能想到这一层的候选人很少。
E2 · 推理模型、模型路由与成本 / 延迟优化
学习目标
在模型层建立成本与延迟的主动治理能力。
课程内容
- 推理模型的适用与不适用场景
- 模型路由:按任务难度或类型分流到不同规模模型
- 级联(cascade):小模型先答,不确定再升级大模型
- Prompt 缓存与语义缓存
- 结构化输出 / 约束解码降低重试成本
- 批处理与并发对吞吐的影响
- Token 预算、上下文压缩与 compaction
- 成本、延迟、质量的三角权衡与 SLO
实施任务
- 实现一个 Model Router:把简单意图或抽取分流到小模型,复杂推理走推理模型
- 接入语义缓存,度量命中率与成本下降
- 输出一份同一业务任务路由前后成本、延迟、质量的对比报告
验收标准
- 路由策略可配置、可观测、可回退
- 缓存不污染需要实时性的结果
- 成本下降有数据支撑且质量不低于基线门禁
面试考点
- 「AI 功能太贵了怎么降本?」:这题在有真实线上业务的团队几乎必问。四层答:上下文预算(程序员基础版第 5 周)、Prompt 缓存、模型路由与级联、结构化输出降重试。报出你的实测成本下降百分比和质量不降的证据。
- 「语义缓存的坑在哪?」:答实时性数据不能缓存、以及相似度阈值定得松会返回错误答案。踩过坑的人才答得出第二条。
E3 · 多模态 Agent 与 VLM
学习目标
让 Agent 具备图文理解与图文生成能力,并可被安全治理。
课程内容
- VLM 图文理解工具(图片到结构化信息)
- 多模态检索(图像向量化加 HNSW,文搜图 / 图搜图)
- 文生图 / 图文生成作为受控工具(草稿、水印、合规)
- 多模态 RAG(图文混排文档解析、OCR 边界)
- 多模态输入的成本、延迟与安全(图片注入、敏感内容)
实施任务
- 为电商场景实现商品图片到规格抽取的工具(VLM)
- 实现文搜图检索工具并接入 Agent
- 把详情页 / 标题生成类图文生成作为高风险工具,纳入审批与合规检查
验收标准
- 多模态工具遵循与文本工具同一套 Schema / 权限 / 审计规范
- 生成类工具默认只产草稿并可审批
- 多模态检索有可解释分数与延迟记录
面试考点
- 「图片能被用来做 Prompt Injection 吗?」:能。图片里的文字会被 VLM 读到并可能被当作指令。答外部图片内容一律当不可信数据,权限层兜底。这个攻击面知道的人不多。
- 「多模态成本怎么控制?」:答图片分辨率与 token 数的关系、先用小模型过滤再上 VLM。
E4 · 结构化数据 Agent(Text-to-SQL)
学习目标
构建企业最高频的自然语言查询数据库能力,且可控、可审计。
课程内容
- Text-to-SQL 的重写、思考、生成多阶段推理
- Schema 语义检索与动态 Schema 剪枝(列过滤降噪)
- 混合召回:向量检索(Schema / 术语)加倒排(精确值)
- 业务术语与字段名的语义对齐(词库 / HyDE)
- SQL 安全:只读、行级 / 列级权限、注入防护、执行超时与结果规模限制
- 结果解释、可视化与引用(回指原表 / 原字段)
- 高并发异步执行与缓存
- NL2SQL 专用 Eval(执行正确性、结果一致性、拒答)
实施任务
- 实现一个
text-to-sql工具或子 Agent,接入一个多表业务库 - 强制先拆解意图、再定位表和列、再生成 SQL 的三阶段
- 建立 50 到 100 条 NL2SQL 评测集(含难例与应拒答样本)
验收标准
- 只读与权限边界不可被绕过
- 复杂多表查询有 Schema 剪枝与混合召回支撑
- 每个回答可回溯到具体表或字段
- NL2SQL 执行正确率与拒答 F1 有基线并纳入 Eval Gate
面试考点
这个模块的面试出现率在四个 E 模块里最高,因为几乎每家公司都想做问数。
- 「表很多 Schema 塞不进上下文怎么办?」:答 Schema 语义检索加动态剪枝。这是这个方向的第一道门槛题。
- 「怎么防止 SQL 注入和越权查询?」:答只读连接、行列级权限、生成后的 SQL 静态校验、执行超时与结果规模限制四层。注意生成的 SQL 要在执行前校验,不能信任模型输出。
- 「用户问的业务术语和字段名对不上怎么办?」:答术语词库加语义对齐。这题考的是有没有做过真实业务,教程级实现都是字段名直接匹配。
- 「怎么评测 Text-to-SQL?」:答执行正确性优于字符串匹配(同一个查询有多种写法),再加拒答 F1。拒答能力是这个方向最容易被忽略也最重要的指标:答不了的问题老实说答不了,比编一个跑得通但结果错的 SQL 强得多。
复习与延伸
- vLLM 部署(E1)
- PEFT(E1)
- Anthropic Prompt Caching(E2)
- OpenAI Structured Outputs(E2)
- Diffusers 与 CLIP(E3)
- Spider / BIRD Text-to-SQL 基准(E4)
下一步:Staff 能力矩阵