构建 AI 自动化评测与质量体系,支撑多产品策略迭代
项目目标
面向小米 AI 搜索、Miclaw、超级小爱和小米教育中心的高频迭代,建立覆盖模型输出与端上执行的质量评估机制,为模型横评与版本回归提供依据。
核心工作
- 平台建设:搭建 Agent 流式评测与手机端 E2E 自动化平台,贯通模型回复、录屏、截图、Logcat 与 Trace,让评测结果可追溯到执行过程。
- 质量标准:围绕任务完成度、工具调用、内容质量与结构化输出建立 LLM-as-a-Judge 评测体系,统一模型横评与版本回归的评价口径。
- 根因分析:关联评测结果、Bad Case、Langfuse Trace 与 Git 提交记录,构建“质量表现—执行链路—代码变更”的证据链,输出根因分析报告,为策略修复提供参考。