西门大妈
26-09-25 09:41 微博认证:情感博主 头条文章作者

由于裴轶老师2017年和2019年的论文过于....牛逼,我决定反过来,我看最新的!你看这篇写AI的,绝对是非常新的了吧?

裴轶,汪雨波. 人工智能供应链中的垄断风险与竞争法因应[J]. 山东科技大学学报(社会科学版),2025,27(6): 35-43.

这篇论文号称要“审视 AI 供应链”,但是它怎么描述云服务市场竞争格局的呢:
“头部企业如亚马逊的网络服务和微软的软件系统占据了较大的市场份额。”

一个专门研究AI供应链的论文,把全球第二大云平台 Microsoft Azure 叫成了"软件系统",就....你确实也不能说他错了,但一般来说,我们会说Azure 是云计算平台,提供虚拟机、GPU 算力租用、存储和网络,我们不管他叫"软件系统"。

这就好比你不会把丰田写成"一家卖车的五金店"。论文的核心论点之一是"云市场被头部企业垄断",这个论点对错再说,但是咱能先把头部企业的名字打对了吗?

这篇文章是这么介绍大模型训练数据的:
“公开数据方面,ChatGPT 是 3000 亿单词语料训练而成,其中大部分语料来自公开语料库,少部分来自网页文本、书籍、维基百科及用户生成数据。”

首先这里“3000 亿”指的是 GPT-3 ,因为后面的 GPT-3.5、GPT-4 用了什么数据、用了多少,OpenAI 从未公开。但是这个“3000 亿”不是裴轶教授说的“单词语料”,而是token。token不是单词,甚至大模型世界里就没有"单词"这个单位。Token这玩意是AI的最基础的计量单位,你这都搞不懂,咱要不放过AI?也放过自己吧~

即便忽略这俩错误,就算她写的是token好了,这句话依然不对。因为GPT-3公开过自己的 语料权重,Common Crawl是大头,和这里写的“少部分来自网页文本"完全相反。

写到这儿我突然有点明白她为啥犯这个错误了,她是不是不知道Common Crawl是干啥的....

而且更拧巴的是,网页文本也是公开语料库啊...

这句话就好比说,曹老板喜欢的大部分都是人类,少部分是圆脸络腮胡、肌肉男和眼镜斯文男。但现实中,曹老板喜欢的大部分是圆脸络腮胡,少部分是肌肉男,更少一部分是眼镜斯文男,他们仨显然不能被排除“人类”的范畴。

论文还写道:
“预训练阶段,数据用于构建基础模型的知识图谱。”

“知识图谱”和大语言模型的预训练是两回事。大语言模型的预训练好比饭店备菜,把所有原料买回来,洗、切、腌。“知识图谱”好比菜谱,一道菜几克盐、先放油还是先放葱,一条条给你落到纸上。

这俩当然有关系,但这不等于说他腌了一整晚的肉,你就能宣布他写好了一本菜谱。

这篇文章写的是AI领域反垄断,结果连AI的头部企业都没搞懂是谁。它写AI市场“被微软、谷歌、OpenAI 三大巨头分割”。

且不说OpenAI和微软的关系也不是什么秘密,Anthropic是不配拥有姓名吗?

国内的AI头部厂商也是同样的待遇,论文列出的头部厂商是"阿里云、腾讯云、京东云、华为云以及百度智能云....

京东出息了~

天翼云和移动云:????我呢我呢我呢?

如果说以上还属于对AI不怎么了解导致的常识性错误(你别管为啥不了解要写论文),后面那就是不同的章节在打架了。这个中招的就是Deepseek:

开头:
“在国家政策的大力扶持之下,DeepSeek、月之暗面等公司成功进入人工智能核心市场,抢占百度、字节跳动等科技巨头原先的市场份额。”

中间说:
“DeepSeek-R1 模型的出现也意味着以往单纯堆积算力的方式可能并非发展基础模型的最优解。可以预见的是,未来英伟达的市场地位将会受到挑战。”

结尾却说:
“在先发优势影响下,初创企业很难在人工智能训练领域找到突破口。”

量子态Deepseek的命运...

而且DeepSeek 不就是在芯片管制基础上,用远低于头部的成本训练出的模型吗?它用的也是公开模型啊,所以Deepseek本身不就是文中说的“GPU 供应垄断挡死初创企业"和"优质数据垄断挡死初创企业”的现成反例吗?

这篇文章摘要里面写的是::
“优质数据垄断的现实问题使得初创企业难以研发出与大型科技公司性能相当的基础模型……应当参照必需设施原则,合理、有序地开放认定为必需设施的优质数据集。”

但论文写着写着得出的结论是:
1 用于对齐的优质用户数据"并非只有特定数字平台才能收集,缺少这种数据并不阻碍经营者进入相关市场";
2 预训练用的公开数据"本身不具有竞争性",不属必需设施调整范围;
3“若非竞争对手进入特定相关市场所必需……不能机械地视为必需设施,否则将破坏企业收集、利用相关数据的激励。”

这看起来一点也不需要开放啊?

这个论文的逻辑问题不止这一出,它先说"公开数据几乎已被基础模型尽数纳入训练数据集",所以公开数据不再构成壁垒,随后又说"仅利用这些公开数据预训练的基础模型,难以建立竞争优势",简单地说就是所以公开数据没用。

????你到底在说啥?????你的论点到底是什么?你这前后看着都不像一个人写的啊?我写八卦脚踩西瓜皮也不能滑向相反方向吧?

你敢信这是2025年度工信部指导性软课题(GXZK2025-2-57)?????

就有没有一种可能,你要研究某个领域的供应链垄断,你得先了解下这个领域?这事在北理工任何一个理工科院系,任意抓一个老师或者学生,了解的都比这多....

发布于 北京