数据治理
基于合同的 AI 训练数据采集
这里概述 Bracket Bridge 如何处理客户控制、注重同意的 AI 训练数据工作,涵盖语言、口音、人类反馈、智能体轨迹和任务型数据集。
最后更新:2026 年 7 月 18 日
运营模式
- 每个数据采集合作都通过书面协议或项目授权确定范围。
- 客户通常控制项目目的、数据集要求、验收标准和允许用途。
- Bracket Bridge 根据约定范围组织招募、采集、验证、质检、去标识化和交付。
常见数据集类型
- 语言、语音、口音、转录和评估数据。
- 人类反馈、排序、偏好、标注和任务回答数据。
- 智能体轨迹数据,包括操作轨迹、提示-响应流程、屏幕或工具使用序列以及决策路径记录。
- 用于产品测试、模型评估或特定市场 AI 工作流的专门数据采集。
参与者处理
当项目涉及人类参与者时,采集流程应说明收集内容、收集原因、参与是否自愿、补偿方式、谁接收输出,以及如何提出撤回或删除请求。
去标识化与匿名化
只要项目范围允许,交付会围绕匿名化或去标识化输出进行设计。原始标识符应在不再为验证、付款、安全或合同记录所需后被最小化、分离、限制访问或删除。
质量与可审计性
数据集会根据项目规格、采集规则、重复或欺诈检查、格式要求、市场背景和客户验收标准进行验证。客户需要时,可以保留审计记录。
地区合规立场
美国、香港、欧盟/欧洲经济区、英国、瑞士及其他地区要求会在项目层面处理,因为正确机制取决于参与者所在地、客户所在地、数据类型、目的、传输路径,以及 Bracket Bridge 是处理者、服务提供者还是独立控制者。