基于AllenAI Open Instruct框架的Tulu 3后训练流程
本文介绍了一种使用AllenAI的Open Instruct框架构建紧凑型指令调整语言模型的端到端后训练流程。该流程包括三个主要阶段:监督微调、直接偏好优化和基于GRPO的可验证奖励强化学习,同时将原始多GPU Tulu 3堆栈适配为适合16GB运行环境的轻量级版本。通过克隆Open Instruct仓库并选择性加载其原生损失函数和工具,配置LoRA适配器,并准备GSM8K数据以适应每个训练阶段。此外,在整个工作流程中保留了Open Instruct的核心优化逻辑,同时用Hugging Face和PyTorch的轻量级实现替代了分布式组件如vLLM、Ray actors、DeepSpeed以及异步rollout队列。
