难得,字节还开源了一个大模型Seed-OSS-36B。
以前,一向是不开源大模型的。
特点:
灵活控制思维预算:允许用户根据需要灵活调整推理长度。这种动态控制推理长度的能力提高了实际应用场景中的推理效率。
增强的推理能力:专门针对推理任务进行了优化,同时保持平衡和出色的通用能力。
代理智能:在工具使用和问题解决等代理任务中表现异常出色。
研究友好型:鉴于在预训练中包含合成指令数据可能会影响训练后研究,我们发布了有和没有指令数据的预训练模型,为研究社区提供了更多样化的选择。
原生长上下文:原生训练高达 512K 的长上下文。
这种规模的模型量化后,在本地跑不错。
不过,这个能比Qwen强吗?
模型地址:huggface.co/ByteDance-Seed/Seed-OSS-36B-Instruct
发布于 江苏
