归零归零归ww
24-11-28 12:24

上月训练的56M语言模型,成本高于1克黄金,智力低下,几乎无法解决任何实际问题。终端部署是能行的,性能是可以接受的,唯一有潜力的是瑟琴机器人这种恰好需要幻觉但是创造力又很有限的场景。

而现在正在训练的168M模型,已经训练了半个多月,吃掉了100多亿词元,但是远远不够。

目前看到的各种数百数千M级小规模模型,包括Qwen、Phi、SmolLM、MiniCPM等等,在解决事实性问题上都不是很堪用,但是在解决通用的语义理解类问题上还是有一定用处的。监督微调归根结底还是体力劳动,我个人没法承担这么大的工作量。

发布于 江苏