大语言模型(LLM)的目标就是通用认知能力(这次Hinton的keynote是说reasoning是认知的本质)。一个好的大语言模型必须具备解决通用问题、泛化能力、常识推理和自我学习的能力。在过去的五年中,OpenAI的GPT-3学习了常识知识,o1则使用强化学习在响应前进行思考,显著提升了在编程、数据分析和复杂数学方面的推理能力。然而,现有模型仍非真正通用:有些擅长编程,有些擅长数学,有些擅长推理,但没有一个能在所有不同任务中取得最佳表现。
我们团队100来人折腾了将近半年,天天被喷,主要是老不成功,我们终于推出两位GLM家族新成员:GLM-4.5和GLM-4.5-Air——这是我们最新的旗舰模型。GLM-4.5拥有总计3550亿参数和320亿激活参数,而GLM-4.5-Air则拥有总计1060亿参数和120亿激活参数。两者都旨在将推理、编程和代理能力整合到单一模型中。http://t.cn/A6FtPYY2
没想到一开源几个小时就到了huggingface的trending第9名,欢迎大家都来试试 http://t.cn/A6FtauYa
发布于 上海
