SFT数据构建的核心原则

1. 数据格式要求

SFT数据通常采用对话格式,包含指令(instruction)、输入(input)和输出(output)三个部分:

{
  "instruction": "请将以下中文翻译成英文",
  "input": "今天天气很好",
  "output": "The weather is very good today"
}

2. 数据来源策略

高质量人工标注数据

  • 专业标注团队编写指令-响应对
  • 覆盖目标领域的各种场景
  • 确保回答的准确性和专业性

现有数据转换

  • 将问答对、文档等转换为指令格式
  • 例如技术文档 → 问答指令对
  • 代码注释 → 代码生成指令

合成数据生成

  • 使用大模型生成基础数据
  • 人工审核和修正
  • 扩展数据多样性

3. 数据质量关键指标

多样性

  • 指令类型多样(问答、生成、分类、推理等)
  • 领域覆盖全面
  • 难度层次分明

准确性

  • 输出内容正确无误
  • 符合事实和逻辑
  • 格式规范统一

平衡性

  • 各类任务比例合理
  • 避免数据偏差
  • 考虑边缘案例

4. 具体构建流程

需求分析
数据规划
数据收集
数据清洗
格式转换
质量检查
最终数据集

阶段1:需求分析

  • 确定微调目标(代码生成、问答、创作等)
  • 明确领域范围
  • 设定质量标准

阶段2:数据规划

  • 设计指令模板
  • 制定标注规范
  • 分配数据比例

阶段3:数据收集与处理

  • 收集原始数据
  • 转换为标准格式
  • 去除噪声数据

5. 实用工具推荐

数据标注工具

  • Label Studio
  • Doccano
  • Prodigy

数据处理库

  • Hugging Face Datasets
  • Pandas for data manipulation
  • Regular expressions for cleaning

6. 最佳实践建议

  1. 从小规模开始:先构建1000-5000条高质量数据测试效果
  2. 迭代优化:根据模型表现调整数据分布
  3. 质量控制:建立严格的质量检查流程
  4. 领域专注:针对特定应用场景定制数据
Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐