为什么国产模型比美国模型落后 3 个月?大概是这么推算的:
- 一个月的时间蒸馏数据
- 一个月的时间训练模型
- 一个月的时间测试和发布
然后就等着美国再发新模型,重复这三个月的循环。
国内搞算法架构基础创新的,只有 DeepSeek 和 RWKV,是不受这三个月的框架影响的
发布于 北京
为什么国产模型比美国模型落后 3 个月?大概是这么推算的:
- 一个月的时间蒸馏数据
- 一个月的时间训练模型
- 一个月的时间测试和发布
然后就等着美国再发新模型,重复这三个月的循环。
国内搞算法架构基础创新的,只有 DeepSeek 和 RWKV,是不受这三个月的框架影响的