田春冰河
26-03-03 11:45

[1/3] 科研工作往往离不开数据处理(尤其是 AI 和大模型相关),管理各种数据最佳的方式是把他们存储到关系型数据库里,可到了查询数据的时候往往受限于数据库查询语句的能力,比如标准 SQL 语言最多支持用 LIKE 匹配带有通配符的字符串,然后每个数据库平台都有自己的正则表达式扩展。但要想做到搜索引擎级别的数据查找,就要在查询发生前对数据做有效的索引,把文本分拆成 token(中文要进行分词),其他格式(PDF/XML/JSON)要自动提取有效文本,还要支持模糊查找,对多个搜索结果进行相关度打分等。目前能做到这点的,也就只有 Oracle 数据库了,而且这个功能(Oracle Text)在 20 多年前就开发出来了。我要玩大模型的话,一行 Python 的文本处理代码都不想写,要让数据完全在数据库里做预处理,再让数据库直接调用 FPGA 程序去训练大模型。

发布于 辽宁