HelloGitHub
25-02-06 18:17 微博认证:微博新知博主 科技博主

过年期间,DeepSeek 开源的推理模型 DeepSeek-R1 真是火出圈了!我这个 AI 门外汉,也忍不住来围观一下~#AI创造营##deepseek#

1. DeepSeek-R1 智商比肩 OpenAI o1 正式版,同时网页端免费使用,API 服务价格超低:
- 输入(缓存命中):1 元/百万 tokens
- 输入(缓存未命中):4 元/百万 tokens
- 输出:16 元/百万 tokens

2. 他们将 DeepSeek-R1 训练技术全部开源(论文+模型权重),并且采用 MIT 协议(允许商用),地址:github.com/deepseek-ai/DeepSeek-R1

DeepSeek 带来的惊喜,不仅是超低的训练成本和服务价格,其开源的训练技术细节,更是给一份送给全球的开源大礼。

最后,我作为一个 AI 门外汉,在看了网上铺天盖地的文章和视频后,也来分享一些实用的资源,希望对大家有所帮助:

1. 针对 DeepSeek 服务卡顿、不可用的情况,可以关注官方服务状态页:status.deepseek.com 目前已有所改善。

2. 本地/离线运行 DeepSeek-R1 听起来很酷,但真的玩玩就好。因为使用体验好、有智商的 LLM 至少需要 32B 参数的版本(模型体积 20GB),运行它需要大于 20GB 的显存或内存,这不是普通的电脑能跑起来的。如果你想尝试本地部署,以下两个开源项目绝对好使:
- ollama:一条命令即可在本地运行 LLM 模型服务,地址:github.com/ollama/ollama
- open-webui:用户友好的 LLMs 聊天 Web 界面,适配多种 LLM API 服务,地址:github.com/open-webui/open-webui

3. 关于 LLM 蒸馏、微调等专业操作,是有门槛的,感兴趣可以先看看下面这两本 LLM 入门级的开源书籍和训练小型语言模型的实战教程:
- 《大模型基础》(作者主要来自浙江大学):github.com/ZJU-LLMs/Foundations-of-LLMs
- 《大语言模型》(作者主要来自人民大学):github.com/LLMBook-zh/LLMBook-zh.github.io
- minimind:从零开始训练小型语言模型:这不仅是一个微型语言模型的实现,更是一份入门 LLM 的教程,旨在降低学习和上手 LLM 的门槛 。它提供了从数据预处理到模型训练、微调和推理的全流程代码和教程。最小模型仅 0.02B 参数,可在普通 GPU 上轻松运行。地址:github.com/jingyaogong/minimind

虽然这些资料可能无法让完全不懂编程的小白直接入门 LLM,但至少能帮你甄别网上哪些是真正有价值的干货。

发布于 北京