Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
ISO/IEC 26137:2023 为人工智能系统的验证建立了权威框架。AI 系统验证与传统软件验证存在根本性不同,因为 AI 系统的行为是从数据中学习的,而不是显式编程的。这意味着验证不仅必须解决功能正确性,还必须解决统计性能、泛化能力、对分布偏移的鲁棒性、跨人群的公平性以及输出的可解释性。该标准提供了一套全面的验证方法,涵盖数据验证、模型验证、行为验证和运营验证,确保 AI 系统在部署前适合其用途,并在整个运营生命周期中保持这种状态。
该标准定义了四种相互关联的验证类型:数据验证确保用于训练、验证和测试的数据集满足质量要求,包括完整性、一致性、准确性、代表性和无偏差;模型验证评估训练好的模型在预定义指标和验收标准下的性能,涵盖准确率、精确率、召回率、F1分数、ROC-AUC以及应用特定指标;行为验证检查 AI 系统在边缘情况、对抗条件下以及不同人口群体中的行为,以识别故障模式和偏差;运营验证在预期的部署环境中评估 AI 系统,包括与现有系统的集成、人机交互以及在现实运营条件下的性能。
ISO/IEC 26137 提供了一套全面的验证指标目录,按 AI 任务类型(分类、回归、聚类、生成、强化学习)和质量属性(性能、鲁棒性、公平性、可解释性、安全性)组织。对于分类系统,指标包括准确率、精确率、召回率、F1分数、混淆矩阵分析、ROC分析、精确率-召回率曲线、校准误差和子组特定性能分析。对于回归系统,指标包括平均绝对误差(MAE)、均方根误差(RMSE)、R平方、预测区间和残差分析。该标准还引入了 AI 特定指标,如分布偏移检测(总体稳定性指数、KL散度)、模型不确定性量化(预测熵、蒙特卡洛丢弃不确定性)和公平性指标(人口统计均等、机会均等、均等概率)。
| 验证类型 | 关键指标 | 验收标准依据 | 验证频率 |
|---|---|---|---|
| 数据验证 | 完整性、准确性、代表性、偏差指标 | 领域要求、监管标准 | 每次数据更新周期 |
| 模型验证 | 准确率、精确率、召回率、F1、AUC-ROC、校准误差 | 业务要求、风险承受能力 | 每次训练运行 |
| 行为验证 | 边缘案例通过率、对抗鲁棒性、子组公平性 | 风险评估、监管要求 | 部署前及重大变更后 |
| 运营验证 | 延迟、吞吐量、可用性、用户满意度 | SLA要求、运营约束 | 部署前及运营期间定期 |
该标准提供了设置验收标准的详细指导,强调标准应:(a)可测量——用清晰的指标和阈值定义;(b)依赖上下文——反映特定 AI 应用的风险级别和领域要求;(c)统计基础——考虑抽样变异性和置信区间;(d)多维度——涵盖性能、鲁棒性、公平性和可解释性;(e)可审计——记录清晰的理由和支持证据。验收标准应在验证开始前建立,并应获得相关利益相关者(包括领域专家、风险管理人员和监管机构)的批准。
该标准规定了结构化的验证过程,包括:验证规划(定义范围、指标、验收标准、测试方法和资源需求)、验证执行(按系统顺序进行四种验证类型,记录结果和管理偏差)、验证分析(解释结果、评估符合验收标准的情况、识别不符合项和根本原因分析)、验证报告(生成全面的验证报告,记录所有发现、决策和证据)和验证维护(在 AI 系统的整个运营生命周期中进行持续监控和定期重新验证)。验证报告是一个关键工件,可作为法规合规、审计目的和利益相关者沟通的证据。
暂无下载文件