团队在github上开源了一个slime, 是为 RL scaling 设计的 LLM post‑training 框架,提供两大核心能力:
高性能训练:通过连接 Megatron 与 SGLang,支持各种模式的高效训练;
灵活的数据生成:通过自定义数据生成接口以及 server based engine,实现任意的数据训练数据生成流程。欢迎大家玩一玩
发布于 北京
团队在github上开源了一个slime, 是为 RL scaling 设计的 LLM post‑training 框架,提供两大核心能力:
高性能训练:通过连接 Megatron 与 SGLang,支持各种模式的高效训练;
灵活的数据生成:通过自定义数据生成接口以及 server based engine,实现任意的数据训练数据生成流程。欢迎大家玩一玩