AI Agent 工程师课程
程序员进阶版

E 模块 · 进阶扩展(选修)

微调服务、模型路由与成本优化、多模态 Agent、Text-to-SQL,把模型层能力真正接入 Agent OS

定位:选修 · 前置:E1 与 E3 建议先完成 F 轨道对应模块

这些模块把模型层能力真正接入 Agent OS,是从会用别人模型的 Agent 工程师走向能定制模型、控成本、做多模态与结构化数据的 Staff 的关键。每个模块产物同样遵循代码、测试、文档、演示四类。

哪个最值得先做

如果只选一个,做 E4(Text-to-SQL)。它是企业里最高频的 Agent 需求,面试出现率远高于其他三个,而且不依赖 GPU 资源就能完整做完。E2 次之,因为成本治理是任何团队都在意的。

E1 · 模型定制与微调服务

学习目标

让 Agent OS 支持挂载自训 / 微调模型,并把何时微调变成可复用的平台能力。

课程内容

  1. 微调对比 RAG 对比 Prompt 的决策矩阵
  2. 训练数据来源与治理(线上 Trace 转数据集、数据均衡、大模型数据增强)
  3. LoRA / QLoRA 训练流水线
  4. 训练任务的队列化与 GPU 资源管理
  5. 模型注册、版本与血缘(数据集 → 训练 → 权重 → 评估)
  6. 微调模型的离线评估与基线大模型对比
  7. vLLM / 量化部署与 Model Gateway 接入
  8. 微调模型的灰度、回滚与成本核算

实施任务

  • F4 产出的 LoRA 小模型(分类 / 抽取)在 Agent OS 中注册为一个 Provider
  • 通过 Model Gateway 让某个工具或节点使用该微调模型
  • 记录该任务从大模型切到微调小模型的准确率、延迟、成本三方对比

验收标准

  • 微调模型可被 Agent Definition 按版本选用
  • 每个微调模型可追溯训练数据集与评估结果
  • 有明确的何时该微调、何时不该微调的判据文档
  • 微调模型上线走同一套 Eval Gate

面试考点

  • 「你们自己训过模型吗?」:答训过什么规模、解决什么问题、省了多少成本。重点讲三方对比数据,不要讲训练过程细节。
  • 「线上数据能拿去训练吗?」:这题有合规陷阱。答要看授权范围和数据分类,引到 A9 的数据权利。能想到这一层的候选人很少。

E2 · 推理模型、模型路由与成本 / 延迟优化

学习目标

在模型层建立成本与延迟的主动治理能力。

课程内容

  1. 推理模型的适用与不适用场景
  2. 模型路由:按任务难度或类型分流到不同规模模型
  3. 级联(cascade):小模型先答,不确定再升级大模型
  4. Prompt 缓存与语义缓存
  5. 结构化输出 / 约束解码降低重试成本
  6. 批处理与并发对吞吐的影响
  7. Token 预算、上下文压缩与 compaction
  8. 成本、延迟、质量的三角权衡与 SLO

实施任务

  • 实现一个 Model Router:把简单意图或抽取分流到小模型,复杂推理走推理模型
  • 接入语义缓存,度量命中率与成本下降
  • 输出一份同一业务任务路由前后成本、延迟、质量的对比报告

验收标准

  • 路由策略可配置、可观测、可回退
  • 缓存不污染需要实时性的结果
  • 成本下降有数据支撑且质量不低于基线门禁

面试考点

  • 「AI 功能太贵了怎么降本?」:这题在有真实线上业务的团队几乎必问。四层答:上下文预算(程序员基础版第 5 周)、Prompt 缓存、模型路由与级联、结构化输出降重试。报出你的实测成本下降百分比和质量不降的证据。
  • 「语义缓存的坑在哪?」:答实时性数据不能缓存、以及相似度阈值定得松会返回错误答案。踩过坑的人才答得出第二条。

E3 · 多模态 Agent 与 VLM

学习目标

让 Agent 具备图文理解与图文生成能力,并可被安全治理。

课程内容

  1. VLM 图文理解工具(图片到结构化信息)
  2. 多模态检索(图像向量化加 HNSW,文搜图 / 图搜图)
  3. 文生图 / 图文生成作为受控工具(草稿、水印、合规)
  4. 多模态 RAG(图文混排文档解析、OCR 边界)
  5. 多模态输入的成本、延迟与安全(图片注入、敏感内容)

实施任务

  • 为电商场景实现商品图片到规格抽取的工具(VLM)
  • 实现文搜图检索工具并接入 Agent
  • 把详情页 / 标题生成类图文生成作为高风险工具,纳入审批与合规检查

验收标准

  • 多模态工具遵循与文本工具同一套 Schema / 权限 / 审计规范
  • 生成类工具默认只产草稿并可审批
  • 多模态检索有可解释分数与延迟记录

面试考点

  • 「图片能被用来做 Prompt Injection 吗?」:能。图片里的文字会被 VLM 读到并可能被当作指令。答外部图片内容一律当不可信数据,权限层兜底。这个攻击面知道的人不多。
  • 「多模态成本怎么控制?」:答图片分辨率与 token 数的关系、先用小模型过滤再上 VLM。

E4 · 结构化数据 Agent(Text-to-SQL)

学习目标

构建企业最高频的自然语言查询数据库能力,且可控、可审计。

课程内容

  1. Text-to-SQL 的重写、思考、生成多阶段推理
  2. Schema 语义检索与动态 Schema 剪枝(列过滤降噪)
  3. 混合召回:向量检索(Schema / 术语)加倒排(精确值)
  4. 业务术语与字段名的语义对齐(词库 / HyDE)
  5. SQL 安全:只读、行级 / 列级权限、注入防护、执行超时与结果规模限制
  6. 结果解释、可视化与引用(回指原表 / 原字段)
  7. 高并发异步执行与缓存
  8. NL2SQL 专用 Eval(执行正确性、结果一致性、拒答)

实施任务

  • 实现一个 text-to-sql 工具或子 Agent,接入一个多表业务库
  • 强制先拆解意图、再定位表和列、再生成 SQL 的三阶段
  • 建立 50 到 100 条 NL2SQL 评测集(含难例与应拒答样本)

验收标准

  • 只读与权限边界不可被绕过
  • 复杂多表查询有 Schema 剪枝与混合召回支撑
  • 每个回答可回溯到具体表或字段
  • NL2SQL 执行正确率与拒答 F1 有基线并纳入 Eval Gate

面试考点

这个模块的面试出现率在四个 E 模块里最高,因为几乎每家公司都想做问数。

  • 「表很多 Schema 塞不进上下文怎么办?」:答 Schema 语义检索加动态剪枝。这是这个方向的第一道门槛题。
  • 「怎么防止 SQL 注入和越权查询?」:答只读连接、行列级权限、生成后的 SQL 静态校验、执行超时与结果规模限制四层。注意生成的 SQL 要在执行前校验,不能信任模型输出。
  • 「用户问的业务术语和字段名对不上怎么办?」:答术语词库加语义对齐。这题考的是有没有做过真实业务,教程级实现都是字段名直接匹配。
  • 「怎么评测 Text-to-SQL?」:答执行正确性优于字符串匹配(同一个查询有多种写法),再加拒答 F1。拒答能力是这个方向最容易被忽略也最重要的指标:答不了的问题老实说答不了,比编一个跑得通但结果错的 SQL 强得多。

复习与延伸

下一步Staff 能力矩阵

On this page