Strata 是一个开源推理引擎,让 12GB 显存的消费级显卡在本地能运行 125B 参数的 Qwen 3.8 Flash Next。它以 llama.cpp 为基础,通过把热点专家放显存、全量专家放内存、查找表放 SSD 的优化,再配合猜测验证算法提速,实现了在 RTX 5070 上生成速度每秒 53 到 94 个 token。
点评:MoE 模型每次只激活少数专家,这给分层存储留出了空间,Strata 把这点用到了极致。但代价也明显,包括需要 32GB 以上内存,并且只能串行处理单个请求,以及必须采取较为激进的量化策略等。但对于个人使用或者小规模长场景,仍然是个好的思路。