[ SECTION / POSTS ]
文章
博客文章
27 篇内容01
POSTS / 2026.08.03 / 3 MIN
Qwen3.8-Max 发布:2.4T 参数编程实测、下周开源,AI 编程格局要变?
Qwen3.8-Max 正式发布:2.4T 总参数、95B 激活,首次开源 Max 级权重(下周 HF+ModelScope 放出)。编程实测 16 天自主跑出 265 次提交,PaperBench 93.0 全场第一;SWE-bench Pro 仍落后 Claude Fable 5。附 Claude Code / Codex 接入方法。
↗
02
POSTS / 2026.08.02 / 3 MIN
谁杀了 RSS?Google 关掉 Reader 那年,互联网坏掉了一块
Google Reader、FeedBurner、Chrome RSS 按钮、Google Alerts RSS……Google 不是不喜欢 RSS,它喜欢 RSS 带来的用户,然后一个个关掉出口。今天 HN 494 分的热帖让这段历史重新浮出水面。
↗
03
POSTS / 2026.08.02 / 2 MIN
AI 代码的坏模式会自我复制:3 处变 30 处,没人发现
AI 代码腐烂不是「质量差」,而是一种结构性不同的技术债:模型把现有代码当风格指南,会忠实复制其中的错误模式。人类团队 3 处就会在 code review 拦下,AI 会静默扩散到 30 处。
↗
04
POSTS / 2026.08.02 / 2 MIN
Cursor 账单没了:官方亲口说,刻意设计
7月31日,Cursor 悄悄删除了用量页的美元数字,API 字段清零,官方亲口承认「deliberate design」。与此同时,一张真实测试数据显示不同 Agent harness 的 token 消耗相差 30 倍。这不是 UI 改版,是一个商业信号。
↗
05
POSTS / 2026.08.01 / 3 MIN
AI Agent 开始上班了:YC 开源的 qm,让整个团队共用一套 Agent
YC 团队开源 qm:一个多人协作 Agent 工作台。每个员工有独立沙箱和专属记忆,也能在 Slack 频道、群组和项目里与同事共享 Agent。HN 465 分背后,真正的难题不是 Agent 循环,而是作用域隔离与信任治理——Agent 从个人助手变成团队员工的第一个完整答案。
↗
06
POSTS / 2026.08.01 / 3 MIN
2.78 万亿参数、29GB 内存、每秒半个字:Kimi K3 真的在笔记本上跑起来了
一个纯 C 写的推理引擎 WASTE,把 2.78 万亿参数的 Kimi K3 塞进了 64GB 笔记本:982GB 模型按需从磁盘流式读取专家权重,实测 0.5 tok/s。每秒半个字慢到离谱,但它证明了万亿参数模型的本地运行是工程问题,而不是钱的问题。
↗
07
POSTS / 2026.07.30 / 1 MIN
给AI六天和数千美元,它完成了所有代码,却没做出研究
前沿 Agent 连续工作六天、耗费数千美元,完成了全部工程实现——但原论文作者看完结果,两份投稿都被退回。这五类失败,对程序员同样成立。
↗
08
POSTS / 2026.07.30 / 2 MIN
AI开始接管Word、Excel和PPT,但这份成绩单让人冷静
百度发布 OmegaUse-OfficeVal 基准:100 个真实办公任务,6 个主流 Agent 实测,最强者只拿到人类 64% 的分数,38% 任务直接零分。AI 更快更便宜,但还不会签收。
↗
09
POSTS / 2026.07.28 / 3 MIN
看屏幕还是看代码?StateAct 和 JarvisHub 揭示了 GUI Agent 的两种未来
7月28日 HuggingFace 最热论文解读:Salesforce 的 StateAct 用程序状态替代像素做长程 GUI 操作,JarvisHub 构建多模态创意 Agent 开放测试台——两种路线决定了 Computer-Use Agent 的未来走向
↗
10
POSTS / 2026.07.28 / 3 MIN
Claude Opus 5 被低估、Kimi K3 1.56TB 开源、GLM 5.2 成安全首选:2026 年 7 月模型格局巨变
7 月三连击:Anthropic Claude Opus 5 前端编程登顶但遭低估,Moonshot Kimi K3 2.8 万亿参数开源但许可证倒退,智谱 GLM 5.2 被 HuggingFace 选为安全取证首选——三股力量如何重塑开源/闭源格局
↗
POSTS / 2026.08.03 / 3 MIN
Qwen3.8-Max 发布:2.4T 参数编程实测、下周开源,AI 编程格局要变?
Qwen3.8-Max 正式发布:2.4T 总参数、95B 激活,首次开源 Max 级权重(下周 HF+ModelScope 放出)。编程实测 16 天自主跑出 265 次提交,PaperBench 93.0 全场第一;SWE-bench Pro 仍落后 Claude Fable 5。附 Claude Code / Codex 接入方法。
↗
02
POSTS / 2026.08.02 / 3 MIN
谁杀了 RSS?Google 关掉 Reader 那年,互联网坏掉了一块
Google Reader、FeedBurner、Chrome RSS 按钮、Google Alerts RSS……Google 不是不喜欢 RSS,它喜欢 RSS 带来的用户,然后一个个关掉出口。今天 HN 494 分的热帖让这段历史重新浮出水面。
↗
03
POSTS / 2026.08.02 / 2 MIN
AI 代码的坏模式会自我复制:3 处变 30 处,没人发现
AI 代码腐烂不是「质量差」,而是一种结构性不同的技术债:模型把现有代码当风格指南,会忠实复制其中的错误模式。人类团队 3 处就会在 code review 拦下,AI 会静默扩散到 30 处。
↗
04
POSTS / 2026.08.02 / 2 MIN
Cursor 账单没了:官方亲口说,刻意设计
7月31日,Cursor 悄悄删除了用量页的美元数字,API 字段清零,官方亲口承认「deliberate design」。与此同时,一张真实测试数据显示不同 Agent harness 的 token 消耗相差 30 倍。这不是 UI 改版,是一个商业信号。
↗
05
POSTS / 2026.08.01 / 3 MIN
AI Agent 开始上班了:YC 开源的 qm,让整个团队共用一套 Agent
YC 团队开源 qm:一个多人协作 Agent 工作台。每个员工有独立沙箱和专属记忆,也能在 Slack 频道、群组和项目里与同事共享 Agent。HN 465 分背后,真正的难题不是 Agent 循环,而是作用域隔离与信任治理——Agent 从个人助手变成团队员工的第一个完整答案。
↗
06
POSTS / 2026.08.01 / 3 MIN
2.78 万亿参数、29GB 内存、每秒半个字:Kimi K3 真的在笔记本上跑起来了
一个纯 C 写的推理引擎 WASTE,把 2.78 万亿参数的 Kimi K3 塞进了 64GB 笔记本:982GB 模型按需从磁盘流式读取专家权重,实测 0.5 tok/s。每秒半个字慢到离谱,但它证明了万亿参数模型的本地运行是工程问题,而不是钱的问题。
↗
07
POSTS / 2026.07.30 / 1 MIN
给AI六天和数千美元,它完成了所有代码,却没做出研究
前沿 Agent 连续工作六天、耗费数千美元,完成了全部工程实现——但原论文作者看完结果,两份投稿都被退回。这五类失败,对程序员同样成立。
↗
08
POSTS / 2026.07.30 / 2 MIN
AI开始接管Word、Excel和PPT,但这份成绩单让人冷静
百度发布 OmegaUse-OfficeVal 基准:100 个真实办公任务,6 个主流 Agent 实测,最强者只拿到人类 64% 的分数,38% 任务直接零分。AI 更快更便宜,但还不会签收。
↗
09
POSTS / 2026.07.28 / 3 MIN
看屏幕还是看代码?StateAct 和 JarvisHub 揭示了 GUI Agent 的两种未来
7月28日 HuggingFace 最热论文解读:Salesforce 的 StateAct 用程序状态替代像素做长程 GUI 操作,JarvisHub 构建多模态创意 Agent 开放测试台——两种路线决定了 Computer-Use Agent 的未来走向
↗
10
POSTS / 2026.07.28 / 3 MIN
Claude Opus 5 被低估、Kimi K3 1.56TB 开源、GLM 5.2 成安全首选:2026 年 7 月模型格局巨变
7 月三连击:Anthropic Claude Opus 5 前端编程登顶但遭低估,Moonshot Kimi K3 2.8 万亿参数开源但许可证倒退,智谱 GLM 5.2 被 HuggingFace 选为安全取证首选——三股力量如何重塑开源/闭源格局
↗