Series · 0 篇文章 · 3 张笔记卡

评估与测试

把 AI 系统的质量保障做成可回归、可度量的工程实践。

01

把 AI 评估做成回归测试:从样例集到发布门禁

整理一套把 AI 输出质量纳入工程回归测试的实践:样例集、评分器、失败样本和发布门禁。

02

合成评估数据怎么用:补边界,不替代真实样本

说明合成数据在 AI 评估中的适用位置:扩展边界案例、对抗样例和格式样例,但不能替代真实用户问题。

03

AI 代码审查清单:让模型先找风险而不是先夸代码

整理适合 AI 辅助代码审查的提示结构、输出格式和风险优先级。