所有人都来两句#Deepseek# ,那我也聊两句—— Pro才是V4完全体,1.6T参数+49B的激活,从这个数据来看MoE的模型激活参数量超100B指日可待。25年的MoE走了一些弯路,低激活参数的MoE智能确实会更差一些,只能解决 Task 导向的问题。真要展现出“超出预期的智能”只能加大激活量,甚至学A社,做超大参数的Dense模型
发布于 广东
所有人都来两句#Deepseek# ,那我也聊两句—— Pro才是V4完全体,1.6T参数+49B的激活,从这个数据来看MoE的模型激活参数量超100B指日可待。25年的MoE走了一些弯路,低激活参数的MoE智能确实会更差一些,只能解决 Task 导向的问题。真要展现出“超出预期的智能”只能加大激活量,甚至学A社,做超大参数的Dense模型