LLM in a Flash

把 400B 大模型塞进 48G 内存：LLM in a Flash 背后的魔法

Apple 2023 年的一篇论文，让 4000 亿参数的模型跑在了普通 MacBook 上。核心技术 MoE + 量化，背后藏着一个关于’按需调用’的工程哲学。

March 24, 2026 · 2 min · 242 words · 梦兽编程