读 Anthropic 的 Harness Design:AI 写代码的瓶颈,正在从模型转向组织
同一个模型、同一句需求,为什么单 Agent 做出了不能玩的游戏,而一套 Planner、Generator、Evaluator 组成的 Harness 却能交付可用应用?读完 Anthropic 的实验,我最大的感受是:模型能力只是原料,真正决定交付质量的,是外面那套会规划、验收、纠错和删减自己的工作系统。
View Article同一个模型、同一句需求,为什么单 Agent 做出了不能玩的游戏,而一套 Planner、Generator、Evaluator 组成的 Harness 却能交付可用应用?读完 Anthropic 的实验,我最大的感受是:模型能力只是原料,真正决定交付质量的,是外面那套会规划、验收、纠错和删减自己的工作系统。
View ArticleLoop Engineering 不是把提示词写得更长,而是把 AI 从一次性问答,改造成会定时发现问题、分派任务、验证结果、记录状态的工作循环。这篇从普通用户能上手的角度,讲清楚 loop 是什么、什么时候该用、怎么从一个最小 loop 搭到能长期跑的自动化流程。
View Article上一篇里那个会自己挖漏洞、写攻击的恐怖模型,两个月后公开发布了,名字叫 Fable 5,价格还砍了一半多。一边喊'这玩意危险',一边把它放出来——这事到底怎么圆的?这篇从零讲清楚 Mythos 和 Fable 5 是什么、强到什么程度、以及它凭什么敢公开。
View ArticleAnthropic 红队评估了内部预览模型 Mythos Preview 的攻击性网络安全能力。报告把「发现漏洞」和「利用漏洞」两件事分开来量化,结论是:它不仅能在主流操作系统和浏览器里找出无人知晓的零日,还能全自主地把漏洞写成可用的攻击链。本文按报告的逻辑,分层梳理它具体做到了什么、用什么方法验证、以及边界在哪。
View ArticleAnthropic 发了一篇博客,说他们正和顶尖化学家一起把 Claude 往实验室里送。第一份白皮书没挑什么花哨的题目,而是选了化学家每天都要做的苦活——读核磁谱图。我读完之后,想把它讲清楚,顺便聊聊我的几点想法。
View Article同样是代币化货币体系的顶层设计,统一账本与 mBridge 究竟在哪里分叉?从 2022 年六周真实资金试点到 2026 年原型机,两套方案在「商业银行存款要不要上链」这一问题上走向了完全不同的路。
View Article从功能设计到架构原理,从与 SWIFT/RTGS 的本质差异到主权、法律、技术三重障碍,系统拆解统一账本模型到底在做什么、难在哪里。
View ArticleBIS 最新研究与 Project Agorá 原型机落地,揭示了金融基础设施的下一个十年将长什么样——不是颠覆,而是一次深度的系统性升级。
View Article