数据治理

基于合同的 AI 训练数据采集

这里概述 Bracket Bridge 如何处理客户控制、注重同意的 AI 训练数据工作,涵盖语言、口音、人类反馈、智能体轨迹和任务型数据集。

最后更新:2026 年 7 月 18 日

运营模式

  • 每个数据采集合作都通过书面协议或项目授权确定范围。
  • 客户通常控制项目目的、数据集要求、验收标准和允许用途。
  • Bracket Bridge 根据约定范围组织招募、采集、验证、质检、去标识化和交付。

常见数据集类型

  • 语言、语音、口音、转录和评估数据。
  • 人类反馈、排序、偏好、标注和任务回答数据。
  • 智能体轨迹数据,包括操作轨迹、提示-响应流程、屏幕或工具使用序列以及决策路径记录。
  • 用于产品测试、模型评估或特定市场 AI 工作流的专门数据采集。

参与者处理

当项目涉及人类参与者时,采集流程应说明收集内容、收集原因、参与是否自愿、补偿方式、谁接收输出,以及如何提出撤回或删除请求。

去标识化与匿名化

只要项目范围允许,交付会围绕匿名化或去标识化输出进行设计。原始标识符应在不再为验证、付款、安全或合同记录所需后被最小化、分离、限制访问或删除。

质量与可审计性

数据集会根据项目规格、采集规则、重复或欺诈检查、格式要求、市场背景和客户验收标准进行验证。客户需要时,可以保留审计记录。

地区合规立场

美国、香港、欧盟/欧洲经济区、英国、瑞士及其他地区要求会在项目层面处理,因为正确机制取决于参与者所在地、客户所在地、数据类型、目的、传输路径,以及 Bracket Bridge 是处理者、服务提供者还是独立控制者。