评测驱动的自进化闭环模式(Evaluation-Driven Self-Evolution Pattern)#
模式概述#
通过建设评测体系四层架构(数据采集→标注→评测执行→分析回溯),将人工标注结果分类反馈给双Agent(一个优化漏报、一个优化误报),形成"标注→优化→评测→正确率提升→标注量减少"的正向飞轮。核心价值是让AI系统从"交付型"(上线即顶峰,依赖人工维护)跃迁为"进化型"(上线即起点,通过错误积累持续提升),突破人力维护瓶颈。
触发场景#
满足以下条件时考虑使用此模式:
✅ 系统输出可被明确判定对错(二分类标注)
✅ 错误案例可被持久化为回归用例
✅ 人工维护成本高(效率低、成本浪费、滞后性强)
✅ 系统需要持续优化而非一次性交付
✅ 错误可归因到具体组件(能区分"漏拦截"与"误拦截")
不适用场景:
❌ 无法对输出进行明确对错标注的场景(如开放式创意生成)
❌ 错误案例无法持久化的场景(如实时流式处理无回溯能力)
❌ 系统只需一次性交付无需持续优化(建设评测体系的成本无法摊薄)
核心做法(4步标准化流程)#
步骤1:建设评测体系四层架构#
数据采集层:基于Trace全链路留痕,记录AI的提示词、Response及各引擎结果
标注层:人工打标+重要Case评测集(人工Review拒绝的Case进入黑名单)
评测执行层:构建与线上隔离的评测用流水线与环境
分析回溯层:程序化确定性判定(对了就是对了,错了就是错了)
步骤2:建立"错误黑名单"机制#
人工Review拒绝的Case进入"重要Case评测集"
未来评测回溯时,黑名单Case必须百分之百通过——"犯过的错误绝对不能再犯"
注意:需定期清理过时Case,避免过度拟合历史(详见关联模式:错误黑名单单调进化模式)
步骤3:设计双Agent自进化#
Agent A(AST能力升级Agent):针对"人工标注正确"的场景——AI改对了但AST没拦截住,优化AST引擎
Agent B(检测插件升级Agent):针对"人工标注错误"的场景——AI改错了但检测插件没拦截住,补齐检测插件
两个Agent均遵循工程化工作流:需求理解(生成文档+人工Review)→技术方案编写(架构设计+人工Review)→自动编写代码+智能化代码审查→部署到隔离评测环境进行自动评测
步骤4:构建正向飞轮#
人工标注→系统优化→评测通过→正确率提升→人工标注量减少→趋近于非零下限
飞轮的收敛性:人工标注量的减少不导致系统崩溃,而是让系统进入更高自治水平
注意:人工标注量趋近于非零下限(全新类型错误仍需人工判断),非真正为零
反模式(不要这么做)#
❌ 无评测体系的自进化:无法判断优化是否有效,飞轮无法启动,自进化变成盲目修改
❌ 无"错误黑名单"的自进化:同类错误可能反复出现,进化非单调向上,系统可靠性无保证
❌ 单Agent自进化:无法区分"漏拦截"与"误拦截"两种不同类型的错误,优化方向混乱
❌ 人工标注不持久化:每次优化后无法回溯历史Case,评测无基准,优化效果不可验证
❌ 黑名单只增不减:过度拟合历史错误,对新场景泛化能力下降,需定期清理过时Case
检验标准#
正向飞轮已启动:人工标注量持续下降趋势可量化
错误黑名单Case百分之百通过回归
双Agent分工明确:漏报与误报分别由不同Agent处理
系统维护投入趋近于非零下限(全新类型错误仍需人工)
评测体系覆盖全链路:数据采集→标注→执行→回溯四层完整
迁移验证#
目标场景 |
输出对错判定 |
错误Case持久化 |
双Agent分工 |
可行性 |
|---|---|---|---|---|
代码规范检查器 |
规范违规/合规 |
违规Case入库为回归用例 |
Agent A优化规则/Agent B优化判定 |
✅ |
风控规则引擎 |
误报/漏报 |
误报漏报Case入库 |
Agent A优化规则/Agent B优化阈值 |
✅ |
搜索相关性系统 |
相关/不相关 |
Bad Case入库为回归用例 |
Agent A优化排序/Agent B优化特征 |
✅ |
推荐系统 |
用户满意/不满意 |
负反馈Case入库 |
Agent A优化推荐策略/Agent B优化过滤规则 |
✅ |
实践案例#
快手开关治理自进化体系(2026年):系统维护投入不到一个人力,通过双Agent自进化实现AST引擎与检测插件的持续优化。准确率从初始水平持续提升至98%以上,AST与AI引擎拟合率达80%以上。人工标注量随系统优化持续减少,形成正向飞轮。
来源:闫文亮《让开关自我消亡:AI赋能的Feature Flag全生命周期治理》(QCon 2026北京站)
关联模式#
不确定性探索+确定性校验双引擎架构模式:本模式解决双引擎中程序引擎的人工维护瓶颈
错误黑名单单调进化模式:本模式的"错误黑名单"机制的深化模式
责任转移治理模式:自进化体系的内在驱动力来自责任转移