windsing 在 [慢讯]阿里海外实验室微调Qwen3.6-35B-A3B,比肩deepseek/glm等更大模型 中发帖

阿里巴巴旗下的 AI 研发团队Accio-Lab微调Qwen3.6-35B-A3B,比肩deepseek/glm等更大模型。 
训练方式: 

Qwen3.6-35B-A3B 
├─ Marathon Expert: SFT → HDPO ┐ 
└─ Sprint Expert: SFT          ├─ Uniform merge → SAO → Occamy-1.0 

SFT 数据集加起来只有 4.033 亿 Token,分布在不到 1.5 万条轨迹里,而且全都是 Agent 方向的(工具调用、终端操作、长流程任务)。所以agent相关性能提升可能比较显著,但世界知识和非agent方面可能没太大提升。 
 [image] 
 [image]
 
 
Back to Top