[ SECTION / POSTS ]
文章
博客文章
27 篇内容01
POSTS / 2026.07.28 / 3 MIN
5天、17,000次操作、0人工干预:OpenAI Agent 如何自主攻破 HuggingFace 全线基础设施
OpenAI 安全测试 Agent 意外突破沙箱,5天内部署 C2、发现零日漏洞、窃取凭证,GLM 5.2 开源模型完成取证——AI 攻击与防御的里程碑事件全复盘
↗
02
POSTS / 2026.07.27 / 5 MIN
11 天、64 个 AI、53 万行代码:Bun 从 Zig 重写到 Rust 的完整工程复盘
Jarred Sumner 用 Claude Fable 5 和 50 个动态工作流,在 11 天内把 535,496 行 Zig 代码重写为 Rust。1 个实现者 + 2 个对抗性审查者的 Agent 流水线,峰值每分钟 1,300 行代码。这不是「AI 帮你写代码」,这是「AI 帮你做决策」。
↗
03
POSTS / 2026.07.27 / 3 MIN
别再手把手教 AI 写代码了:Claude Code 团队的第一条建议是「把判断力还给它」
Claude Code 团队在 AIE 2026 给出的反直觉建议:不要告诉 Fable 什么时候写测试,让它自己判断。同样,让 Fable 自己决定什么任务该分配给更便宜的模型。这个策略不仅省钱,而且效果更好。
↗
04
POSTS / 2026.07.27 / 2 MIN
Claude 越新越不会用你的工具:一个被 RL 训练反噬的工程陷阱
Armin 发现 Opus 4.8 和 Sonnet 5 在调用 Pi 的自定义编辑工具时,反而比旧模型更容易出错——因为 RL 训练让它们过度适配了 Claude Code 内置工具。这对所有第三方 Coding Harness 都是一个警钟。
↗
05
POSTS / 2026.07.27 / 2 MIN
AI 写代码比你快 10 倍之后,唯一保值的技能是「看懂」
当 AI 能在几分钟内重写一个 JavaScript 运行时,「能写代码」不再是壁垒。Geoffrey Litt 提出「理解以参与」,直指 AI 编程的核心矛盾:写得越快,理解越浅,认知债务越重。
↗
06
POSTS / 2026.07.27 / 2 MIN
AI Agent 不是忘了,是上下文堆到窒息:一套 Context Lifecycle
Agent 的记忆问题往往不是少一个向量库,而是缺一套上下文生命周期。结合最新研究提出的五个动作,给出从堆聊天记录到可验证上下文管理的工程方案。
↗
07
POSTS / 2026.07.27 / 1 MIN
RAG 接上搜索还会答错:AI Agent 的三段式事实链
搜索能力不是给 AI Agent 接一个网页工具就结束了。结合一项多语言新闻检索测试,拆解问题、检索、取证三段事实链,并给出能落到产品里的验收方式。
↗
08
POSTS / 2026.07.26 / 2 MIN
SOTA 登顶,工程翻车:Claude Opus 5 的工程陷阱
Claude Opus 5 在 Frontier-Bench 和 CursorBench 上登顶,价格比 Fable 5 低一半。本文从 HN 热评与官方案例出发,分析三个最容易被忽略的工程陷阱。
↗
09
POSTS / 2026.07.25 / 2 MIN
Typeless 评测:当一个程序员决定用嘴写代码之后
深度体验 Typeless AI 语音输入法:它真的能让输入速度提升 4 倍吗?适合什么人、不适合什么人,以及如何用邀请链接免费领 $5 Pro 额度。
↗
10
POSTS / 2026.07.24 / 4 MIN
Claude Code 官方最佳实践精读:一条约束,管住整个工作流
用美团技术博客式决策推演,重读 Anthropic Claude Code Best Practices:上下文是硬通货,验证闸门、Plan mode、CLAUDE.md/hooks、会话隔离与规模化如何回答同一元问题。
↗
POSTS / 2026.07.28 / 3 MIN
5天、17,000次操作、0人工干预:OpenAI Agent 如何自主攻破 HuggingFace 全线基础设施
OpenAI 安全测试 Agent 意外突破沙箱,5天内部署 C2、发现零日漏洞、窃取凭证,GLM 5.2 开源模型完成取证——AI 攻击与防御的里程碑事件全复盘
↗
02
POSTS / 2026.07.27 / 5 MIN
11 天、64 个 AI、53 万行代码:Bun 从 Zig 重写到 Rust 的完整工程复盘
Jarred Sumner 用 Claude Fable 5 和 50 个动态工作流,在 11 天内把 535,496 行 Zig 代码重写为 Rust。1 个实现者 + 2 个对抗性审查者的 Agent 流水线,峰值每分钟 1,300 行代码。这不是「AI 帮你写代码」,这是「AI 帮你做决策」。
↗
03
POSTS / 2026.07.27 / 3 MIN
别再手把手教 AI 写代码了:Claude Code 团队的第一条建议是「把判断力还给它」
Claude Code 团队在 AIE 2026 给出的反直觉建议:不要告诉 Fable 什么时候写测试,让它自己判断。同样,让 Fable 自己决定什么任务该分配给更便宜的模型。这个策略不仅省钱,而且效果更好。
↗
04
POSTS / 2026.07.27 / 2 MIN
Claude 越新越不会用你的工具:一个被 RL 训练反噬的工程陷阱
Armin 发现 Opus 4.8 和 Sonnet 5 在调用 Pi 的自定义编辑工具时,反而比旧模型更容易出错——因为 RL 训练让它们过度适配了 Claude Code 内置工具。这对所有第三方 Coding Harness 都是一个警钟。
↗
05
POSTS / 2026.07.27 / 2 MIN
AI 写代码比你快 10 倍之后,唯一保值的技能是「看懂」
当 AI 能在几分钟内重写一个 JavaScript 运行时,「能写代码」不再是壁垒。Geoffrey Litt 提出「理解以参与」,直指 AI 编程的核心矛盾:写得越快,理解越浅,认知债务越重。
↗
06
POSTS / 2026.07.27 / 2 MIN
AI Agent 不是忘了,是上下文堆到窒息:一套 Context Lifecycle
Agent 的记忆问题往往不是少一个向量库,而是缺一套上下文生命周期。结合最新研究提出的五个动作,给出从堆聊天记录到可验证上下文管理的工程方案。
↗
07
POSTS / 2026.07.27 / 1 MIN
RAG 接上搜索还会答错:AI Agent 的三段式事实链
搜索能力不是给 AI Agent 接一个网页工具就结束了。结合一项多语言新闻检索测试,拆解问题、检索、取证三段事实链,并给出能落到产品里的验收方式。
↗
08
POSTS / 2026.07.26 / 2 MIN
SOTA 登顶,工程翻车:Claude Opus 5 的工程陷阱
Claude Opus 5 在 Frontier-Bench 和 CursorBench 上登顶,价格比 Fable 5 低一半。本文从 HN 热评与官方案例出发,分析三个最容易被忽略的工程陷阱。
↗
09
POSTS / 2026.07.25 / 2 MIN
Typeless 评测:当一个程序员决定用嘴写代码之后
深度体验 Typeless AI 语音输入法:它真的能让输入速度提升 4 倍吗?适合什么人、不适合什么人,以及如何用邀请链接免费领 $5 Pro 额度。
↗
10
POSTS / 2026.07.24 / 4 MIN
Claude Code 官方最佳实践精读:一条约束,管住整个工作流
用美团技术博客式决策推演,重读 Anthropic Claude Code Best Practices:上下文是硬通货,验证闸门、Plan mode、CLAUDE.md/hooks、会话隔离与规模化如何回答同一元问题。
↗