glm 5.3的后训练还是厉害的。
模型没变,就是加了后训练,提升非常大。
而deepseek v4 pro的后训练提升就没那么大。
一种猜测是算力不够,只训练了部分场景。
另外一种猜测是有些过拟合,在极简模式下,就能达到灰度测试的那个水平了。
总之,问题应该不是很大,难怪deepseek要融资了,估计再修一修,deepseek v4 pro能追上来。
而flash版本,已经非常棒了,搞智能体很实用了。
发布于 江苏
glm 5.3的后训练还是厉害的。
模型没变,就是加了后训练,提升非常大。
而deepseek v4 pro的后训练提升就没那么大。
一种猜测是算力不够,只训练了部分场景。
另外一种猜测是有些过拟合,在极简模式下,就能达到灰度测试的那个水平了。
总之,问题应该不是很大,难怪deepseek要融资了,估计再修一修,deepseek v4 pro能追上来。
而flash版本,已经非常棒了,搞智能体很实用了。