MiMo-V2.6 进行大规模 RL 训练,细节将陆续开源
Fuli Luo 在 X 上透露,经过近半年研究,团队正对 MiMo-V2.6 进行大规模 RL 训练,扩展了计算量(每步约 20 亿 tokens)、环境(多任务 agentic RL)和裁判计算三方面,细节将陆续开源。
X | mimo rl
MiMo-V2.6 进行大规模 RL 训练,细节将陆续开源
|
|
|
|
文章标签
暂无标签
上一篇
下一篇
相关资源
评论区 (0)
暂无评论,快来抢沙发吧!