Miss汉谟拉比
25-02-10 21:40 微博认证:2024微博年度新知博主 情感博主 头条文章作者

今天又听了声动早咖啡的播客。做个笔记分享
本期讲了deepseek。
节目里解析deepseek为什么会爆火以及挑战。
一、DeepSeek爆火的原因
DeepSeek采用混合专家模型(MoE)架构,还有多头潜在注意力技术(MLA)和动态学习率调度等创新算法,进一步优化了训练效率,降低了模型成本。

DeepSeek的预训练成本极低,其V3模型的训练成本仅为约500多万美元,而OpenAI训练GPT-4的成本则超过1亿美元。

DeepSeek是开源策略。它不仅公开了模型权重和技术细节,还提供了模型的思考过程。开源使得全球开发者能够共同参与改进模型,加速技术迭代,同时也为中小企业和开发者提供了低成本的AI解决方案,降低了行业门槛。
这里播客说了一句话,deepseek影响了英伟达的股价变化,先是跌了。然后又涨了,因为有经济学家认为,效率提升反而会需要更大的资源。

DeepSeek用户很多,提升其知名度。

二、DeepSeek面临的挑战:
DeepSeek训练模型的技术可能涉及对OpenAI等公司数据的使用。而且openAI本来自己也有知识产权的纠纷。

尽管DeepSeek通过算法优化降低了对硬件的依赖,但其训练和推理仍然需要大量的算力。

DeepSeek的崛起对行业巨头如OpenAI和英伟达构成了挑战,这些公司可能会采取措施来应对。
尽管DeepSeek的开源策略吸引了大量用户和开发者,但如何实现商业可持续性仍然是一个挑战。

最后DeepSeek在爆火后面临了服务器频繁宕机和恶意攻击等问题,这对其服务的稳定性和安全性提出了挑战。如何保障用户数据的安全和隐私,以及如何应对恶意攻击,将是其未来需要解决的重要问题。

本期还说了软银对OpenAI 400亿美元投资,后者要在超级碗上播放广告。

还说了美国邮政署在2025年2月4日宣布暂停接收来自中国内地和中国香港的包裹,但不到24小时后又恢复了这一服务的新闻,我觉得这可能有利于中国的跨境电商?#miss汉谟拉比看商业#

发布于 江苏