梦兽编程
AI 套装

[ SECTION / AI ]

大模型 LLM

大模型与 LLM 技术前沿、推理优化与训练实践。
32 篇内容
01 AI / 2026.08.12 / 7 MIN 企业开 30K 招不到 Agent 工程师,会写 Demo 的却找不到工作 企业开 30K 却难招能扛生产的 Agent 工程师。本文把招聘鸿沟拆成四块能力拼图,每块配真实生产案例:Anthropic 多智能体 15 倍 token 账单、Cognition 的反对檄文、AWS 十一年前的退避抖动经典,外加三段可直接运行的代码 02 AI / 2026.07.22 / 4 MIN 三强争霸还是各取所需?llama.cpp、vLLM 与 SGLang 推理框架深度选型 llama.cpp、vLLM、SGLang 不是同一赛道的竞争者,而是三种不同设计哲学。本文不列参数表,只追问一个核心问题:你的流量形态是否匹配框架的设计假设?含 10+ 组生产基准与决策树。 03 AI / 2026.07.21 / 3 MIN BigQuery AI.AGG 深度解析:当 GROUP BY 开始调用 Gemini Google 把 Gemini 接进 BigQuery 聚合函数:AI.AGG 能对文本和图片执行多级批处理,每组返回一个自然语言结论。本文从 SQL 语义、执行机制、成本边界和工程治理四个角度,分析它何时有用、何时危险。 04 AI / 2026.07.16 / 2 MIN 七问 Kimi K3:中国大模型离「好用」还有多远? 月之暗面用一段 36 秒视频宣告 K3 将至。但在 Chatbot Arena 上代号 Kivine 的匿名模型已经在海外开发者圈炸了锅——能跑 3D 页面、能生成视频、敢跟 Fable 5 正面硬刚。本文不列参数表,只聊七个真正值得关心的问题。 05 AI / 2026.04.26 / 1 MIN Sub-Agents vs Agent Teams:那个让你系统翻车的架构选择 真正的问题是「Sub-Agents和Agent Teams到底怎么选」。大多数人在任务复杂时立刻想到多Agent系统,但这往往是错误的起点。理解这个问题的答案,能帮你省下大量返工时间。 06 AI / 2026.04.19 / 2 MIN Claude Opus 4.7 偷偷涨价了?497 位开发者实测告诉你真相 497 位开发者的匿名实测数据揭示:Claude Opus 4.7 因系统提示词膨胀,比 4.6 平均多消耗 37.3% 的 token,API 成本同步上涨。本文用真实数据拆解这波'隐形涨价'的来龙去脉,以及三个立即可用的应对方案。 07 AI / 2026.03.26 / 2 MIN 你的AI Agent会思考,但不会记忆 AI Agent 能推理、能规划、能对话,但每次会话结束就忘得一干二净。Ghost 项目用一套纯 PostgreSQL 的基础设施解决这个问题,让数据库变成 Agent 的记忆宫殿。 08 AI / 2026.03.24 / 2 MIN 把 400B 大模型塞进 48G 内存:LLM in a Flash 背后的魔法 Apple 2023 年的一篇论文,让 4000 亿参数的模型跑在了普通 MacBook 上。核心技术 MoE + 量化,背后藏着一个关于'按需调用'的工程哲学。 09 AI / 2026.03.23 / 2 MIN 告别 90 秒的等待:oMLX 如何在 Mac 上对 Ollama 实现降维打击 oMLX 专为 Apple Silicon 打造,通过 MLX 框架、SSD KV 缓存和连续批处理,将长上下文场景下的 TTFT 从 90 秒降到 1-3 秒,全面超越 Ollama。 10 AI / 2026.03.19 / 3 MIN 一个 Agent 顶一千个:Ramp 教我的企业 AI 落地心法 Ramp 估值 320 亿美元,每年处理 1000 亿美元交易。他们的 AI 之路不走寻常路:不建一百个 Agent,而是用一个 Agent 配一千种技能。本文是他们工程师在大会上的完整分享。