
把 400B 大模型塞进 48G 内存:LLM in a Flash 背后的魔法
Apple 2023 年的一篇论文,让 4000 亿参数的模型跑在了普通 MacBook 上。核心技术 MoE + 量化,背后藏着一个关于'按需调用'的工程哲学。

Apple 2023 年的一篇论文,让 4000 亿参数的模型跑在了普通 MacBook 上。核心技术 MoE + 量化,背后藏着一个关于'按需调用'的工程哲学。
oMLX 专为 Apple Silicon 打造,通过 MLX 框架、SSD KV 缓存和连续批处理,将长上下文场景下的 TTFT 从 90 秒降到 1-3 秒,全面超越 Ollama。

Rust 1.89 宣布 x86_64-apple-darwin(Intel Mac)从 Tier 1 降级为 Tier 2,并引入 mismatched_lifetime_syntaxes lint、常量泛型 '_' …
在 Apple Silicon (M1/M2) 上进行 Zig 性能分析可能会遇到困难,因为 perf、valgrind 等常用工具不受支持。本指南介绍了一些替代工具,如 Samply、poop 和 Tracy,帮助您在 …