跳转到主要内容 / Skip to main content
FDE 指南
FDE 实战方法

FDE 生产级交付与运行

从可用原型走向稳定生产的上线门槛、评测、可观测性、可靠性、回滚和责任分工清单。

作者:FDE 指南编辑组类型:指南框架发布:事实核验:最后更新:

原型能跑,不等于可以生产运行

原型用于验证“这个方案是否值得继续”,生产系统还要证明“它能在真实流量、真实权限和异常条件下持续运行”。FDE 可能亲自负责到生产,也可能与平台、安全、数据和业务团队共同交付;无论组织形式如何,责任都必须明确。

维度原型阶段生产阶段
数据小样本或脱敏副本明确来源、权限、保留、删除和跨境路径
质量演示样例可用代表性评测集、阈值、回归和线上反馈
身份少量测试账号SSO、最小权限、服务账号和审计日志
可靠性手工重试超时、重试、幂等、限流、熔断和降级
变更直接替换 Prompt/模型版本化、灰度、兼容验证和回滚
运行开发者盯着告警、值班、处置手册、SLO 和成本预算
责任“项目组负责”明确业务、技术、安全、数据和供应商负责人

六个上线门槛

1. 结果与责任门槛

  • 目标用户、关键任务和不可接受的失败已经写清
  • 业务指标有当前基线、计算口径、观测周期和数据负责人
  • 明确谁批准上线、谁处理事故、谁能关闭功能
  • 停止条件和退出方案可执行,而不是只有成功计划

2. 架构与数据门槛

  • 画出数据流、信任边界、外部依赖和写回路径
  • 测试、预发布和生产环境隔离
  • 数据最小化,明确保留、删除、备份和恢复规则
  • 对模型、检索库、工具调用和第三方插件分别做风险评估

涉及个人信息、生成内容或跨境数据时,继续使用 安全与合规检查框架

3. 身份与安全门槛

  • 默认拒绝,按任务授予最小权限
  • 用户权限传递到检索和工具层,不能只在页面隐藏按钮
  • 高风险写操作采用确定性校验、审批或双人复核
  • 密钥进入专用密钥管理,不出现在前端、Prompt 和普通日志
  • 完成提示注入、越权检索、工具滥用和敏感信息泄露测试

4. 评测门槛

评测至少分三层:

  1. 离线任务评测:用代表性样本检查正确性、完整性、引用、格式和拒答
  2. 安全与边界评测:覆盖恶意输入、敏感内容、越权、歧视风险和故障场景
  3. 线上运行评测:观察真实采用、人工改写、升级率、投诉、错误和成本

每个结果都要绑定模型、Prompt、检索配置、工具版本和评测集版本。只汇报一个平均“准确率”会掩盖严重少数错误;高风险任务要单列致命错误率和不可接受样本。

5. 可靠性与可观测门槛

先定义用户实际感知的服务指标,再讨论技术指标:

  • 成功完成率、端到端延迟、超时率和降级率
  • 有依据回答率、人工改写率、转人工率和投诉率
  • 单次任务成本、每日预算和异常调用量
  • 外部模型、检索、数据库和业务系统的分段耗时与错误

按业务需要定义 SLI/SLO,并确定事故恢复目标。RTO 表示可接受的恢复时长,RPO 表示可接受的数据丢失窗口;不是所有内部助手都需要金融核心系统级别的目标。

日志和追踪通常需要关联请求、用户或角色、模型与 Prompt 版本、检索来源、工具调用、延迟、费用、错误和人工修改。日志也可能包含敏感数据,因此要做字段最小化、脱敏、访问控制和保留期限设计。

6. 发布与变更门槛

  • 用功能开关控制暴露范围,先内部或小流量灰度
  • 预先定义回滚版本、停止开关和降级路径
  • 模型、Prompt、检索索引或工具变更先跑回归集
  • 对关键接口设置超时、有限重试、幂等键、限流和熔断
  • 外部模型不可用时,明确是排队、转人工、只读还是关闭功能

“换模型无需改代码”不代表没有行为变化。供应商静默升级、上下文窗口、限流、价格和安全策略变化都可能造成回归。

最小运行责任表

事项必须明确的负责人
业务规则与可接受风险业务负责人
应用、集成与故障修复工程/FDE 负责人
模型、Prompt、检索与评测AI/产品/领域专家的明确组合
数据质量、权限与生命周期数据负责人
安全、隐私和法律判断安全、隐私与法务负责人
供应商事故和合同升级采购/供应商负责人
用户培训、反馈与采用业务运营或变革负责人

一人可以兼任多个角色,但不能把责任写成模糊的“AI 团队”。如果要移交,至少交付代码与配置、架构图、依赖清单、评测集、运行手册、告警、权限、已知限制和待办风险。

上线检查清单

  • 业务目标、基线、指标口径和负责人已确认
  • 数据流、权限、外部依赖和风险评审已完成
  • 代表性评测集包含正常、边界、恶意和故障样本
  • 关键失败有确定性保护、人工路径或安全降级
  • 模型、Prompt、检索和工具配置可追踪、可回滚
  • 监控覆盖质量、可靠性、费用、安全和用户反馈
  • 灰度、回滚、停止开关和事故处置手册已演练
  • 值班、升级、供应商支持和业务沟通责任已明确
  • 用户告知、培训、反馈和退出渠道已经上线
  • 上线后的复盘日期和继续/停止标准已经排期

参考框架

本页的六个门槛是本指南整理的交付框架,不是认证标准。可结合 NIST 的自愿性 AI Risk Management FrameworkGenerative AI Profile(NIST AI 600-1) 做 Govern、Map、Measure、Manage 复核。NIST 正在修订 AI RMF 1.0,使用时应核对最新版。最近核验:2026-08-05。

下一步