鸿泽思维
26-06-07 10:38 微博认证:头像本人

#鸿泽长文# title:AI系统工程

content:在AI开发的环节,分成了三段,AI语料处理,AI算法与程序开发,AI集群运维。这三者占比相近,重要性相同,缺一不可。 ​​​AI公司的语料管理部门是非常核心的部门。语料的质量决定了大模型的智力,算法再牛语料不行,训练出来的肯定不行。我们拿烹饪来说,语料就是食材,质地对美食的影响非常大。

训练AI的本质就是在语料的数据中寻找规律,这个规律就是模型的智能,也就是数据化以后的权重。对于商业模型公司来说,权重可以开源,但语料是不可能开源的,即使开源也只是一小部分,无关轻重。这是公司的绝对核心商业机密。甚至模型的算法在很大程度上都是公开透明的,无非是一些微调,但语料的不透明度更大。

无论是电子书、数字资源、爬取的网络数据,这些都不是现成的语料,只是原料。需要经过数据的分类、清洗、优化、整理、标记、配比等多个环节,才能最终形成可训练的语料。拿我三万条微博数据来说,我先要把垃圾数据、乱码、低质量的内容清洗掉,然后将数据分为对话型、观点型、长文型、思想类、时政类,进行归类,再进行配比,对话占10%,观点占20%,思想占30%……最终合成训练数据。语料生成的过程是非常消耗时间的,比模型训练的时间还要长。

模型开发内部分为两个环节,一是模型核心代码,也就是transformer部分的开发,这部分代码相对简单,但数学方面比较复杂。另一块是agent开发,注意,现在所有闭源大模型公司都在内置agent的一些能力。比如说来一个请求是续写的,那就走写作模型,编程的走编程模型,这里都有agent在前边顶着。至于你用的那个agent是端的agent,不是服务内置的。所以,agent的开发比重现在越来越大了,你要写逻辑层来控制用户需求,反而模型服务里这部分代码量是最大的。

对于AI公司来说,运维是非常重要的一环,它涉及数据中心的规划建设、硬件资产与预算管理、网络架构、服务器配置、资源池的建立、管理、监控、核心模型权重和agent的迭代更新、持续发布与优化、SRE服务质量管理、容量管理、BUG分析等。

一个AI模型不是一个应用程序那么简单,是一个庞大的系统工程。

发布于 北京