本文提供试点评估框架,指标与验收条件应由双方预先约定,不代表已实现的效率或良率提升。
带入一个已确认的异常案例
带入一个已确认的异常案例,先按当前演示范围评估单片巡查、已有分析解读、引用准确性与复核投入。下一阶段:补齐加工履历,执行来源定位检查;具体检查、执行能力与交付范围需要事先约定。查看当前演示与试点范围。
面向来源定位,客户关心的是:异常来源能定位到哪一层?还缺什么证据?案例需要有明确异常、可访问材料和能够评审结果的工程师。本轮是否能够回答来源问题,取决于已支持的检查与可用工程记录;巡查发现与来源定位应分别评价。
开始前约定数据范围、比较基线、预期交付和时间窗口。预期交付可以是可复现的发现、证据包和下一轮验证计划;发现缺少关键数据,也应被准确记录。
在相同条件下比较
使用同一份数据快照和同一个工程问题,按客户真实流程记录取数、比较、判断、交付与投入。WaferPilot 辅助流程执行本轮约定的检查,由工程师复核并处理例外;同样保存步骤、实际交付和完整人工介入。已知答案的历史案例可以用于复现检查;尚未解决的问题,可以用于评估新增线索。
历史答案已经提供给 Agent 时,需要注明。不同任务难度、数据条件和人工支持,也要一起保存,方便解释比较结果。
评价洞察,也评价复核成本
| 评价项 | 可以记录的证据 |
|---|---|
| 定位质量 | 来源判断支持到哪一层:工步、设备、腔室或条件;有哪些支持证据、未排除解释与材料缺口 |
| 错误与遗漏 | 按同一标准,由工程师复核错误判断、遗漏的关键检查或证据;无法定位的原因是否被准确记录 |
| 结果可复现 | 同一输入、方法和版本能否重现主要计算结果 |
| 发现有依据 | 发现是否能回到原图、数据来源和运行记录 |
| 调查有增量 | 是否补充有用线索、排除解释或明确关键数据缺口 |
| 建议可验证 | 是否形成具体对象、范围和验证步骤 |
| 工作量变化 | 人工准备、操作、等待、复核和返工分别花了多少时间 |
没有试点结果时,展示的是评估方案;有了结果,再报告两种流程的实际差异。效率应按完整工作过程比较,包含数据准备、工程复核和返工。洞察数量需要结合有效性评价;由工程师判断哪些发现值得继续验证。
一次试点应留下什么
- 问题与数据说明。输入对象、快照标识、可比条件和已知缺口。
- 调查与证据包。按本轮范围保留所用方法、已有科学报告、可用 Pipeline、图像定位和结果口径;缺失材料明确记录。
- 工程评审记录。确认了什么,哪些解释仍待验证,复核需要多少投入。
- 下一轮计划。继续验证的范围、需要补充的数据,以及适合扩大或收缩的场景。
试点发现、过程效率和实际良率影响,应分别记录。真实工程收益需要相应验证数据支持。
用结果决定下一轮范围
当方法与计算可以复现、发现能够核查、建议有明确验证步骤,并且投入与收益符合约定目标时,可以考虑扩大数据或任务范围。若主要精力仍耗在数据对齐与人工纠错,应先解决这些问题。
对管理者而言,一份好的试点总结能说明:产品在哪类任务上增加了价值、依赖什么条件、还有哪些限制,以及下一轮需要什么资源。