dpoalignmentdata-preparationon-premisepreference-data
DPO 数据集格式与本地准备
DPO 数据集由 prompt、chosen 和 rejected 组成。本文说明企业偏好配对的来源,以及在本地完成准备的完整流程。
Edward Xi Yang
直接偏好优化(DPO)是当今企业团队可用的最实用的对齐技术。它引导模型行为——语气、准确性、策略合规、安全性——无需 RLHF 的基础设施复杂性。只需标记为"选择「和」拒绝"的响应对,和一次微调。
偏好数据集格式
{
"prompt": "客户问:'我能退订阅费吗?'",
"chosen": "我可以帮您。我们的退款政策允许在购买后 30 天内全额退款。您能分享一下订单号吗?",
"rejected": "当然,我马上处理您的退款!您应该在 24 小时内看到退回的钱。"
}企业中偏好数据的来源
人类反馈日志、A/B 测试结果、质量审查的模型输出、专家纠正、内部风格指南和合规规则。
准备管道
- 收集提示-响应对(目标 1,000-2,000 个原始集)
- 领域专家排名或选择偏好响应(40-60 对/小时)
- 格式化为 DPO 对
- 标注者间一致性质量检查(Cohen's kappa 高于 0.7)
- 导出为 JSONL(85% 训练 / 15% 验证)