AI 应用服务、质量与交付
AI 应用工程师的价值不只是“接上模型”,而是把不稳定、昂贵、有权限边界的模型调用,交付为可观察、可回滚、可维护的产品能力。
1. 服务边界:前端、业务后端与模型层
text
浏览器 / App
→ 业务 API(鉴权、租户、限流、会话、审计)
→ AI 编排层(Prompt、RAG、工具、输出校验)
→ 模型 / 向量库 / 业务系统- 前端:负责流式呈现、取消、重试、引用展开与用户确认;不保存模型或业务系统的密钥。
- 业务 API:负责身份、租户隔离、配额、会话归属和审计,是权限的最终执行点。
- AI 编排层:只处理上下文、检索、工具与输出校验;工具权限不能由模型提示词决定。
重点 2. 流式响应与长任务
- 对话生成用 SSE 或 WebSocket 逐步返回 token;前端要能处理断线、取消、重复片段和最终完成事件。
- OCR、文件解析、批量索引、报表生成改为异步任务:提交任务 → 返回
job_id→ 轮询或订阅状态 → 读取结果。 - 任何可重试写操作都要有幂等键;否则网络重试可能重复入库、重复调用工具或重复扣费。
重点 3. 多租户、数据与安全
- 每个请求携带经过服务端验证的用户与租户身份;向量检索在检索前做 tenant / ACL 过滤。
- 文件上传先做类型、大小、病毒与敏感信息检查;原文件、解析文本、chunk 和向量都要能按文档 ID 删除。
- Prompt 注入按不可信数据处理:文档不能改变系统指令,工具调用做服务端参数校验,高风险动作要求用户确认。
- 密钥放环境变量或密钥管理服务;日志只记录脱敏后的输入、检索 ID、模型版本和耗时。
重点 4. 评测、可观测性与成本
上线前建立固定的黄金问题集,至少观察:
| 层 | 离线指标 | 线上信号 |
|---|---|---|
| 检索 | Recall@k、MRR、引用命中 | 空检索率、无引用率 |
| 生成 | 忠实度、格式正确率、拒答正确率 | 点踩率、人工升级率 |
| 服务 | 延迟、错误率、重试率 | P50/P95/P99、队列长度 |
| 成本 | 每任务 token / 工具成本 | 单租户配额、缓存命中率 |
- Trace 应覆盖请求 ID、Prompt 版本、模型版本、检索结果、工具调用、token、耗时和错误。
- 改模型、切片、Prompt 或工具参数前后都跑同一黄金集;只看“感觉更好”无法归因。
重点 5. 发布与回滚
- Prompt、模型、检索配置和工具 schema 都要版本化;灰度发布时可按租户或流量比例切换。
- 输出 schema 校验失败、工具超时、检索无证据都要有可解释降级:重试、返回安全提示、转人工或只给来源。
- 监控错误率、TTFT、P95 总延迟、检索空结果率和成本;超过阈值自动回滚到上一个已验证配置。
6. 应用开发岗位的最低交付标准
一个可放进项目经历的 AI 功能,至少能说明:
- 用户问题与成功指标;
- 数据从哪里来、如何更新与做权限隔离;
- 模型 / RAG / Agent 为什么这样选;
- 前端怎样呈现流式、引用、错误和人工确认;
- 怎样评测、监控、控成本与回滚。