【Rust重写AI推理引擎:比Python快11倍】116天前,他只是想做点教学Demo,5070ti上跑Qwen3-4B只有70 tokens/s。半年后,这个叫OpenInfer的项目已经能跟vLLM掰手腕——启动速度3秒对32秒,快了整整11倍,空载内存占用也更轻。
最反直觉的是过载场景:QPS飙到16双方都扛不住时,OpenInfer反而反超6%吞吐。作者说问题都在kernel层,调就完事了。
他更大的野心是拆积木。不想做Python那种大一统怪物,而是让调度器、缓存卸载、kernel优化都变成crates.io上能单独拉的包,像搭乐高一样拼自己的引擎。pegaflow已经跑在线上快一个月没出事了。
你写过什么因为嫌主流方案太笨重,一怒之下自己造轮子的项目?#AI算力# #你重构过最爽的代码是什么#
发布于 江苏
