文章目录

先说结论

实用的 AI 审核工作台会把提议与证据并列,显示差异,让指定审核人作出明确决定。审批应绑定版本,与对外执行分开,错误和重试要能够恢复。单靠复选框,不能证明进行过有意义的审核。

AI 流程可以设有人工审核步骤,却几乎不提供可审核的信息。精美预览和“批准”按钮鼓励人员作决定,但原件、修改字段与后果都可能被隐藏。界面应先帮助发现问题,再要求接受结果。

围绕一项决定和它所需的证据设计收件箱。NIST 的 AI 风险管理框架要求明确责任并评估人工监督。应将这些原则落实为实际权限、信息和操作。引用框架或显示绿色勾选,不代表控制措施已经有效。

示例工作流

证据、决定、执行与回执

  1. 分派审核

  2. 对照证据和提议

  3. 解决重要差异

  4. 记录绑定版本的决定

  5. 执行一次

  6. 核实结果或恢复

快速判断

每个状态都要有准确含义

每个状态都要有准确含义
状态含义可进行的下一步
待审核输出版本已可交给获授权人员审核查看、修改、拒绝或请求补充信息
等待信息缺少一项已指定负责人的决策依据补充证据,然后重新审核
已批准执行审核人接受了确切版本执行允许的操作
执行中/执行失败/已完成执行结果单独记录核实、恢复或查看回执

左右滚动,查看完整比较。

1. 先定义决定,再设计收件箱

列明输出、审核角色、下游操作,以及哪些情况不应批准。批准一套修正单据以便交接,与批准付款是不同决定。识别必须核对的字段和需要专业判断的问题。实际访问范围与决策权限应由后端执行,不能只依赖按钮是否可见。

为每种决定列出必要证据。缺少证据时,提供有负责人和理由的“请求补充信息”操作。在按钮附近说明后果:哪些记录会改变、哪些数据会离开系统,以及能否撤回。不要要求人员确认一个没有说明的结果。

2. 让收件箱显示工作、责任和阻碍

每行显示容易识别的记录编号、拟执行操作、当前状态、负责人、等待时长和阻碍。按约定优先级,如期限或后果排序,允许人员筛选分派给自己的工作。“AI 任务”总数不如清楚显示哪些决定正在等待具体人员处理有用。

采用平静的视觉规则:米白背景上的近黑文字、一致间距,以及用于选中或主要操作的克制蓝色。状态文字本身应表达含义,不依赖颜色。返回列表时保留选中记录和滚动位置,让人员直接继续,不必重新找到原来的位置。

3. 把原始证据放在提议字段旁边

在宽屏上并列原件与提议,按固定顺序显示字段差异。每个字段链接到相关页码或数据行,显示来源版本和提取时间。区分提取值、计算结果与模型建议,让审核人知道需要哪种检查。

假设示例,并非客户项目:出货发票草稿为 12 个,仓库记录为 10 个。显示“发票 12;装箱 10”及两个来源。允许审核人请求澄清,或说明理由后录入已确认的更正。98% 的置信度不能解决实际装了多少件货物的分歧。

4. 让决定与审计记录绑定版本

分别提供“批准”“修改后批准”“拒绝”和“请求补充信息”。修改重要字段或拒绝时要求理由,但不要强迫人员为每次普通接受填写空洞备注。记录审核人、时间、来源版本、输出版本、修改字段及决定,保留原提议以便后续比较。

审批后来源变化,应标记原批准已失效,把新版本送回审核。两人同时操作时,后提交的一方应收到更新后的状态,而不是悄悄覆盖此前决定。为审计记录定义权限和保存安排,避免在每个事件中重复复制不必要的敏感原文。

5. 区分已接受的决定与已完成的操作

“已批准执行”不等于“已完成”。下游系统处理时显示执行中,再记录已核实回执或失败。超时导致结果不明时,显示“正在核实结果”,先向接收端查证再提供重试。第一次操作可能已经成功时,不应鼓励再次点击。

Amazon 的幂等 API 指引说明,可以使用固定请求标识处理重复尝试,避免重复产生同一效果。将该原则应用到已批准操作与版本,由服务器处理重复请求。禁用按钮是有用反馈,但不能阻止重复网络请求。操作改变时应使用新决定和标识,不能沿用旧批准。

6. 用真实审核工作测试键盘、移动端与恢复

按 WCAG 2.2 检查键盘访问、可见焦点、内容重排、错误提示和辅助技术可获取的状态更新。审核人应不使用鼠标也能查看来源、修改字段及作决定。移动端在同一字段标签下上下排列证据与提议,不要硬塞成两个无法阅读的列。操作区域也不能遮住正在使用的控件。

测试正常批准、缺少来源、字段更正、版本变化、两名审核人、重复提交和接收端超时。核实已保存决定与外部结果,不只是查看通知。重新打开失败记录,确认证据和修改仍然可用。测量实际漏掉的差异及恢复投入,再判断审核流程是否有效。

决定之前

审核收件箱必须支持的检查

  • 审核人能够查看相关原件和差异。
  • 每个状态都有下一步与负责人。
  • 审批绑定确切来源和输出版本。
  • 执行、回执及重试与审批分开。
  • 键盘、移动端、并发操作和失败路径可用。

开始之前,常见问题

批准复选框足以证明人工监督吗?

它能记录一次选择,但不能证明查看过什么,或该人是否能作出决定。需要提供证据、权限、有意义的操作和绑定版本的记录,再测试审核人能否发现预期差异。

可以一次批准多个 AI 输出吗?

只有决定、证据和后果适合批量审核时才考虑。显示包含哪些记录与异常,保留每条版本记录,避免待解决项目被批量批准掩盖。

执行失败后,重试前需要再次批准吗?

取决于获批意图与输入是否变化。先核实不明结果。原操作仍有效时,可通过避免重复效果的机制重试;数据或意图改变,则需要重新审核。

资料来源及延伸阅读

  1. NIST AI Risk Management Framework: roles and human oversight
  2. W3C: Web Content Accessibility Guidelines 2.2
  3. Amazon Builders’ Library: making retries safe with idempotent APIs

下一步

工作流自动化

如果这是适合你的方向,可以先厘清范围、测试方式和交接安排。

了解相关服务 讨论项目