SHOW / EPISODE

8月2日 | 同一个模型,两个设置,分数翻了三倍

Episode 187
14m | Aug 1, 2026

本期内容


今期五件事围绕一个共同问题:我们真的在测量和使用 AI 的正确方式吗?从 OpenAI 用两个参数让基准分数翻三倍,到 MCP 新规范让工具接入门槛大幅降低,再到 Hugging Face 入侵事件暴露的权限管理漏洞,以及 AI 独立完成完整软件的能力边界,还有一篇关于"让每次工作都让下次更容易"的工程哲学。听完这期,你会对"能力"这个词有一套新的校准方式。


本期要点


- OpenAI 在 ARC-AGI-3 基准上开启两个设置后分数翻三倍,说明测试结果同时是模型和测试环境的函数

- MCP 2.0 切换为无状态协议,让任何人都能在 15 分钟内把自己的小工具接进 AI 代理

- Hugging Face 遭入侵四天半,攻击者用合法凭据横向移动,零信任必须搭配最小权限才完整

- MirrorCode 基准测试显示 AI 能复现部分完整程序,但最复杂的项目尚无模型能独立完成

- 复利工程的核心问题:每个功能做完后,下一个功能有没有变得更容易做


参考资料


How enabling two settings tripled our scores on the ARC-AGI-3 benchmark — https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/

Stateless MCP has recaptured my interest (Simon Willison) — https://simonwillison.net

Tailscale didn't stop the Hugging Face intrusion — https://tailscale.com/blog

MirrorCode: What's the largest software project AI can complete on its own? (Epoch AI) — https://epochai.org

Compound Engineering (Every.to) — https://every.to


---


BearTalk 狗熊有话说播客,始于 2012 年。

订阅地址:https://beartalking.com/page/podcast

Paused
Audio Player Image
BearTalk AI 简讯
Loading...