奔跑的高达
AI Pulse

GPT-5.6 Sol Ultra 发现 WordPress 零日漏洞链:悬赏价 $500k 的漏洞,用 $25 …

2026 / 07 / 20 · Monday
3 信源验证 HN / GitHub / HuggingFace 社媒热评 AI 自动采集

🔥 今日热点 TOP 5

  1. 🔴 🟢 GPT-5.6 Sol Ultra 发现 WordPress 零日漏洞链:悬赏价 $500k 的漏洞,用 $25 就拿下了 — 安全研究员 Adam Kues 改编 OpenAI 的 CDC 数学证明 prompt,让 GPT-5.6 Sol Ultra 用 4 个 Agent 跑了 10 小时,发现了 WordPress 的预认证 SQL 注入 → 权限提升 → 完整 RCE 链。漏洞赏金市场对此类 RCE 出价 $50 万,而他只花了 $25 的 token 费用。这是 GPT-5.6 本周继解决数学猜想后,在安全研究领域的又一次力证 — 首次报道 07-20 08:13 UTC

  2. 🔴 🟢 当美国 AI 越来越封闭、越来越商业,正在输掉这场比赛 — Ben Werdmuller 在 werd.io 发文,引用 The Verge(Robert Hart)和 a16z Martin Casado 的数据,论证中国开放权重策略(Kimi K3 + Qwen 3.8)正在反超美国闭源路线:Casado 称初创公司中 80% 在用中国模型,美国禁运反而把中国的算力劣势变成了分发优势 — HN 807 分 / 662 评论(当日第 1 热帖)— 首次报道 07-20 14:21 UTC

  3. 🔴 🟢 AI 反例浪潮:Fable 证伪百年 Jacobian 猜想,数学家正在被「反例轰炸」 — 帝国理工学院 Kevin Buzzard(Xena Project / Lean 核心维护者)发文回顾 AI 数学里程碑:ChatGPT 5/20 推翻 Erdős 单位距离猜想、Sol 6/26 完成 Lean 全形式化(120 万行代码)、Fable 在世界杯决赛期间发现了代数几何 100 年未解的 Jacobian 猜想的反例。Buzzard 直言"任何不花 $200/月买 AI 工具的博士生都疯了" — HN 93 分 — 首次报道 07-20 19:03 UTC

  4. 🟢 月之暗面推出 Kimi Work 桌面 Agent:本地文件、Web 自动化、Swarm 协作一站式工作站 — Moonshot AI 发布 Kimi Work,macOS/Windows 桌面 Agent,集成 Cron 引擎 24/7 自动化、WebBridge 浏览器自主操作、Agent Swarm 多 Agent 协同、内置 A 股/港股/美股金融数据源。与 Kimi K3 处于同一周发布,标志着 Moonshot 从模型到桌面产品的完整闭环 — HN 265 分 / 130 评论 — 首次报道 07-20 17:13 UTC

  5. 🔵 arXiv 论文「机器写作」检测:约 1/3 新论文呈 AI 生成特征,CS 领域达 65% — unslop.run 对 12,750 篇 arXiv 论文做全文检测(以 0.4% 误报率校准),发现最近一个季度约 32% 新论文被标为机器写作痕迹,CS 高达 65%、定量生物 56%、数学仅 0.7%。该检测在 2021-2022 年的对照组维持在 0.4%,确认上升来自 LLM 普及而非检测器漂移 — HN 177 分 / 129 评论 — 首次报道 07-20 16:36 UTC


📰 详细资讯

1. GPT-5.6 Sol Ultra 发现 WordPress 零日漏洞链:悬赏价 $50 万的漏洞,用 $25 拿下

  • 摘要:Searchlight Cyber 安全研究员 Adam Kues 将 OpenAI 此前用于证明 Cycle Double Cover 猜想的 Sol 多代理 prompt 改编为安全研究方向,让 GPT-5.6 Sol Ultra 以 4 个 agent 并行探索 WordPress 源码(移除了 .git 目录以防止模型偷看 commit 记录)。10 小时后,Sol 发现了一条完整利用链:(1) 预认证 SQL 注入——在 WordPress 最硬化的攻击面上找到入口;(2) 通过递归批量请求绕过 GET 限制,利用缓存滥用临时冒充管理员身份;(3) 精心构造的假 post 触发 parse_request hook,以管理员角色重放请求,创建新管理员账户;(4) 以上传插件的方式获得 完整远程代码执行(RCE)。作者直言:“以前沿模型的进展来看,没有安全研究员能在 10 小时内找到并完成这条利用链。就算给他们原始 bug 去利用,在那个时间窗口内也是不可能的。“漏洞赏金市场(exploit brokers)对 WordPress RCE 的出价为 $50 万,而他通过 Sol Ultra 只花了约 $25 的 token 费用。该发现延续了 GPT-5.6 本周从数学猜想证明(CDC、凸优化)到安全漏洞挖掘的能力验证。

  • 原文链接:https://slcyber.io/research-center/exploit-brokers-pay-500000-for-a-wordpress-rce-i-found-one-with-gpt5-6/

  • 信源验证

  • 热度指标:HN 365 upvotes / 206 comments(当日 HN 第 3 热帖)

  • 社媒热评

    • “This one is both awesome and scary. We are living in a black mirror episode, where one well-crafted LLM prompt can get you $500k or the ability to hack into 500M websites.” — @vavkamil @HackerNews

    • “The market will quickly adjust to the point where spending $50 on tokens will on average give you a vulnerability valued at $50.” — @wongarsu @HackerNews

    • “Don’t get all starry-eyed, the people owning those sites also have access to LLMs, so both the hacks and paydays are rare.” — @cbg0 @HackerNews

  • 标签:#GPT-5.6 #SolUltra #零日漏洞 #WordPress #安全研究 #RCE #AI能力边界 #CDCprompt #SearchlightCyber

  • 时效性:🟢 突发 — 首次报道于 07-20 08:13 UTC


2. 当美国 AI 越来越封闭、越来越商业,正在输掉这场比赛

  • 摘要:科技博客作者 Ben Werdmuller(werd.io)发布长篇分析,论证中国开放权重 AI 策略正在胜出,美国的闭源封闭路线注定失败。核心论点:(1) AI 模型本身几乎没有护城河——工程师可以通过 API 在 GPT、Claude、Kimi 之间无痛切换,真正绑定在合同和企业服务上;(2) 中国利用开放权重将美国禁运造成的"算力劣势"转化为"分发优势”——模型可以无许可地在全球部署和改造,这在基础设施采纳中几乎总是赢家策略;(3) 引用 The Verge 资深作者 Robert Hart 的报道:月之暗面与阿里推出的模型声称可以在远低于 OpenAI/Anthropic 成本的前提下达到其性能,中国正在对美国 AI 优势发动"一拳两拳组合”;(4) 引用 a16z 合伙人 Martin Casado 在《经济学人》 的说法:任何初创公司有 80% 的概率正在使用中国模型,中国模型有望取得领先;(5) 警告:如果美国 AI 投资泡沫破裂(作者认为这显然会发生),可能导致严重的经济后果。文章最后呼吁推动"公共 AI"(public AI),让开放技术与公共利益对齐。

  • 原文链接:https://werd.io/american-ai-is-locked-down-and-proprietary-its-losing/

  • 信源验证

    • ✅ [werd.io/Ben Werdmuller] American AI is locked down and proprietary. It’s losing. (https://werd.io/american-ai-is-locked-down-and-proprietary-its-losing/) — 07-20
    • ✅ [The Verge] China delivers a one-two punch to America’s AI dominance, by Robert Hart — 07-19/20(被 werd.io 引用为背景)
    • ✅ [The Economist / Martin Casado] 关于中国模型在初创公司中 80% 使用率的评论 — 06-07 月(被引用)
    • ✅ [Hacker News] China’s open-weights AI strategy is winning (https://news.ycombinator.com/item?id=48979269) — 07-20 14:21 UTC — 807 points / 662 comments(当日 HN 第 1 热帖)
  • 热度指标:HN 807 upvotes / 662 comments(当日 HN 第 1 热帖)

  • 社媒热评

    • “It’s inevitable, but also, it’s probably the point. At the moment top-tier models from China are being somewhat-freely shared. It reads to me like forcing competition out by dumping free/cheap things.” — @jvanderbot @HackerNews

    • “Dumping is such a loaded term. This is investor-backed scaling to capture market share, standard VC playbook.” — @aavaa @HackerNews

    • “It will never stop being funny to me that China does the exact same shit American corps have been doing since the 70’s but because it’s scary China it’s suddenly a problem.” — @ToucanLoucan @HackerNews

  • 标签:#开放权重 #中美AI竞争 #AI策略 #a16z #出口管制 #TheVerge #KimiK3 #Qwen3.8

  • 时效性:🟢 突发 — 首次报道于 07-20 14:21 UTC


3. AI 反例浪潮:Fable 证伪百年 Jacobian 猜想,数学家正在被「反例轰炸」

  • 摘要:帝国理工学院教授、Xena Project 创始人(Lean 定理证明器核心维护者)Kevin Buzzard 发布博客,回顾并揭示 AI 数学的最新里程碑。时间线:(1) 5 月 20 日,ChatGPT 推翻 Erdős 单位距离猜想(离散几何),由多名人类数学家背书其论证。Yann LeCun 联合创办的 Logical Intelligence(首席科学家为菲尔兹奖得主 Mike Freedman)在一周内完成了 Lean 形式化。(2) 6 月 26 日,OpenAI 的 Boris Alexeev 使用 Sol 完成了从数学公理出发的完整 Lean 形式化——生成 120 万行 Lean 代码(mathlib 历时 9 年才累积 230 万行),其中包括数论中深层的整体类域论证明。(3) 7 月 Fermat 研讨会期间,Buzzard 为所有参会者购买了 Claude Max 订阅以接入 Fable,OpenAI 也赠送了 Pro 访问以接入即将发布的 Sol。哈佛已向所有博士生、博后和教师免费提供 Fable 访问。(4) 7 月 20 日(世界杯决赛期间),Levent Alpöge 在 X 上宣布 Fable 发现了 Jacobian 猜想的反例——这是一个已存续 100 年的代数几何著名问题。Paul Lezeau 已手动完成反例的形式化并 PR 到 DeepMind 的 Formal Conjectures 仓库。Buzzard 在结论中写道:“我告诉系里的教授——在我看,任何不花 $200/月使用这些工具的博士生,才是疯了。“这篇文章承接上周的 CDC 证明与凸优化空白,将"AI 做数学"从猜想证明推进到反例发现的新范式。

  • 原文链接:https://xenaproject.wordpress.com/2026/07/20/human-mathematicians-are-being-outcounterexampled/

  • 信源验证

    • ✅ [Xena Project / Kevin Buzzard] Human mathematicians are being outcounterexampled (https://xenaproject.wordpress.com/2026/07/20/human-mathematicians-are-being-outcounterexampled/) — 07-20
    • ✅ [Hacker News] 同标题讨论帖 (https://news.ycombinator.com/item?id=48983382) — 07-20 19:03 UTC — 93 points / 22 comments
    • ✅ [Levent Alpöge @X] Fable 发现 Jacobian 猜想反例(经 Buzzard 博客确认,约 07-19 晚或 07-20 初)— 博客中描述为"12 小时前”
    • ✅ [DeepMind Formal Conjectures repo] Paul Lezeau 已完成形式化并提交 PR — 07-20
    • ✅ [背景·Boris Alexeev/OpenAI] Sol 完成 Erdős 猜想全形式化(含整体类域论,120 万行 Lean)— 06-26
    • ✅ [背景·Logical Intelligence] ChatGPT 推翻 Erdős 猜想后一周内完成 Lean 形式化 — 05-26
  • 热度指标:HN 93 upvotes / 22 comments;但内容权威性极高(Kevin Buzzard 身份:帝国理工教授、Lean/mathlib 核心人物)

  • 社媒热评

    • 该帖评论数不多但来自数学/形式化圈子的认可度很高,Buzzard 博客所述"哈佛已向所有博士/博后/教师免费提供 Fable 访问"和"帝国理工教授认为不买 AI 工具的博士生才是疯了"成为讨论焦点
  • 标签:#Jacobian猜想 #Fable #数学 #形式化 #Lean #XenaProject #KevinBuzzard #Sol #LogicalIntelligence #DeepMind #反例

  • 时效性:🟢 突发 — 07-20 发布,Jacobian 猜想反例约于 07-19/20 之交被发现


4. 月之暗面推出 Kimi Work:下一代桌面 Agent,一站式知识工作台

  • 摘要:月之暗面(Moonshot AI)发布全新桌面应用 Kimi Work(macOS/Windows),定位为"知识工作者的 AI 桌面”。核心功能:(1) 24/7 自动化——内置 Cron 引擎,可定时执行 LLM Agent 调用、Python 脚本等后台任务;(2) WebBridge 浏览器自动化——以自然语言指令驱动浏览器完成多步骤网页任务的自主 Agent;(3) Agent Swarm——自动协调多个专业 Agent 并行分解和解决复杂多层任务,结果可一键转为 PowerPoint/Excel;(4) 原生金融数据——预集成 A 股、港股、美股深度数据源,可自然语言拉取财报、分析市场异常;(5) 本地文件深度连接——直接读取本地文件夹,执行代码前需显式授权(“Ask before acting”)。Kimi Work 与 Kimi K3 在同一周发布,标志着月之暗面从开放权重模型到桌面产品的完整闭环——以桌面为切入口,将模型能力直接嵌入用户本地工作流。

  • 原文链接:https://www.kimi.com/products/kimi-work

  • 信源验证

  • 热度指标:HN 265 upvotes / 130 comments

  • 标签:#KimiWork #月之暗面 #桌面Agent #Swarm #浏览器自动化 #金融AI #本地Agent #KimiK3

  • 时效性:🟢 突发 — 首次报道于 07-20 17:13 UTC


5. arXiv 论文「机器写作」检测:约 1/3 新论文呈 AI 生成特征

  • 摘要:AI 写作检测平台 unslop.run 发布大规模 arXiv 论文 AI 写作测量研究。对 12,750 篇论文全文(非摘要)进行检测,以 0.4% 误报率校准(99.6% 的 ChatGPT 前论文不被误报)。核心发现:(1) 最近一个完整季度约 32% 新论文被标为机器写作痕迹,峰值接近 39%(2026 年初);(2) 分领域差异巨大——计算机科学 65.0%(最高)、定量生物 56.3%、电气工程 51.3%、经济学 47.0%、应用物理 34.0%、凝聚态 24.0%、高能物理 14.0%、天体物理 10.7%、数学仅 0.7%(最低);(3) 2021-2022 年对照组在各领域均为 0-3.5%,确认上升来自 LLM(ChatGPT、Claude 等)普及而非检测器漂移;(4) 作者强调这是 下限估计——实际使用率可能更高(检测器对某些模型/风格不敏感)。数学的低使用率可能与其高精度要求有关(直到最近才有 AI 能可靠处理数学证明)。该研究作为"学术写作中 AI 渗透率"的一个里程碑数据点,引发关于学术诚信、同行评审质量和作者身份的广泛讨论。

  • 原文链接:https://unslop.run/blog/measuring-ai-writing-on-arxiv

  • 信源验证

  • 热度指标:HN 177 upvotes / 129 comments

  • 标签:#arXiv #AI写作 #学术诚信 #检测 #CS论文 #机器学习 #LLM

  • 时效性:🔵 深度 — 非事件驱动的数据分析/研究论文,07-20 发布


6. Kimi K3、Qwen 3.8 与 Anthropic 的潜在解体:前沿实验室的经济学剖析

  • 摘要:Emerging Trajectories 创始人 Wojciech Gryc 发表深度分析,从经济学角度解构前沿 AI 实验室的竞争格局。核心论点:(1) 基础设施所有权决定利润率——租赁数据中心/电力(Anthropic、月之暗面、智谱)的模型公司边际成本随收入增长,利润率无法规模扩张;拥有数据中心和电厂(Alibaba、Meta、SpaceX)的则将边际成本变成固定成本,规模越大利润率越高;(2) Fable 5 严重不经济——每完成一个任务的成本约是 OpenAI 或开源模型的 3 倍;(3) Anthropic 的独特脆弱性——过度倚重监管策略(AI 伦理叙事)和"递归自我改进"叙事,但其"护城河产品"(Claude Code、Cowork)所在的 Harness 市场进入壁垒极低(OpenCode、OpenClaw、Hermes 等一众初创创新中);(4) 这比 2025 年 DeepSeek 时刻更大——因为证明的是"多家实验室都能追赶甚至超越资本充足的美国实验室",而非单次事件;(5) OpenAI 相比 Anthropic 的优势在于多元化布局——消费硬件、数据中心所有权、语音/网站/产品体验都有更清晰的护城河。结论:除非出现监管干预或真正的 AGI,Anthropic 将难以保持 #1 模型供应商地位。

  • 原文链接:https://www.emergingtrajectories.com/lh/frontier-lab-economics/

  • 信源验证

  • 热度指标:HN 248 upvotes / 248 comments(评论数等于 upvotes,反映高度争议和讨论质量)

  • 社媒热评

    • “How is OpenAI not a ‘model-only’ provider just like Anthropic?” — @drob518 @HackerNews

    • “They are trying to diversify into consumer hardware and also are further along in owning data centers. The consumer hardware product, assuming it launches and does decently well, puts them in a very unique position.” — @cl42(文章作者)@HackerNews

    • “ChatGPT is synonymous with non technical/work related LLMs. They’re amassing a ton of user history… You can see a future where a user types…” — @treis @HackerNews

  • 标签:#前沿实验室 #经济学 #Anthropic #OpenAI #KimiK3 #Qwen3.8 #Fable5 #基础设施 #护城河

  • 时效性:🔵 深度 — 07-19 发布,07-20 在 HN 引爆 248 分 / 248 评论的广泛讨论


7. Nativ:在 Mac 上本地运行前沿开放模型

  • 摘要:开发者 aratahikaru5 发布 Nativ,一款在 Mac 上本地运行前沿开放大模型的工具。在开放权重模型(Kimi K3、Qwen 3.8、Bonsai-27B 等)本周密集发布的背景下,Nativ 满足了"希望隐私本地运行最新 SOTA 模型"的 Mac 用户需求。

  • 原文链接:https://blaizzy.github.io/nativ/

  • Hacker News:https://news.ycombinator.com/item?id=48982681 — 07-20 18:16 UTC — 111 points / 43 comments

  • 热度指标:HN 111 upvotes

  • 标签:#本地推理 #Mac #开放模型 #隐私

  • 时效性:🟢 突发 — 07-20 发布


8. BestBlogs EP123 精选:Vidu S1 实时视频、PPIO Agent 云、Netflix GenPage

  • 摘要:BestBlogs 07-20 早报(EP123)精选三个重点:(1) Vidu S1 实时视频生成——在消费级 GPU 上实现 540P 25-42 FPS 的实时视频生成,通过算子融合+SageAttention+稀疏注意力将扩散压缩至约 4 步,TurboServe 部署层处理多卡并行与流式调度;(2) PPIO Agent 云——创始人姚欣访谈,提出"Token 工厂的第一客户从人变成 Agent"。PPIO 2026 年 6 月日均处理 Token 超 1.2 万亿,架构包括模型网关路由、上下文工程、沙箱(微型虚拟机冷启动 < 200ms)、Harness 长任务管理;(3) Netflix CPTO Elizabeth Stone 谈 AI 组织——GenPage 用单一生模型替换整个个性化主页管线的候选生成/排序/布局,离线损失改善,服务延迟降低 20%,通过线上 A/B 测试判断参与度变化。Qwen3.8 官方参数确认为 2.4T(非 2.2T 或更小)。

  • 原文链接:https://www.bestblogs.dev/explore/brief/2026-07-20

  • 标签:#ViduS1 #实时视频 #PPIO #Agent云 #Netflix #GenPage #Qwen3.8 #组织AI

  • 时效性:🟡 跟进 — Qwen3.8 参数确认、Vidu S1 系统化报道


排名 项目 星标 描述 今日新增 链接
1 tirth8205/code-review-graph ⭐ 23,000 本地优先代码知识图谱(MCP/CLI),为 AI 编码工具削减上下文 +1,876 GitHub
2 diegosouzapw/OmniRoute ⭐ 21,641 免费 MIT AI 网关:一个端点接入 268+ 供应商 500+ 模型(含 Kimi K3),500+ 贡献者 +1,300 GitHub
3 rohitg00/ai-engineering-from-scratch ⭐ 40,465 从零学 AI 工程:Learn it. Build it. Ship it. +846 GitHub
4 jamiepine/voicebox ⭐ 44,104 开源 AI 语音工作室:克隆、听写、创作 +839 GitHub
5 msitarzewski/agency-agents ⭐ 134,648 完整 AI 代理机构:从前端向导到 Reddit 社区忍者,每 Agent 有专长与交付物 +744 GitHub
6 KnockOutEZ/wigolo ⭐ — AI 编码代理专用 Web:MCP 本地搜索/抓取/爬虫/研究,$0/query +695 GitHub
7 1jehuang/jcode ⭐ 9,567 最智能的代码 Agent harness +612 GitHub
8 Robbyant/lingbot-map ⭐ — Feed-forward 3D 基础模型,从流式数据重建场景 +554 GitHub
9 kvcache-ai/ktransformers ⭐ 18,718 异构 LLM 推理/微调优化的灵活框架 +448 GitHub
10 MoonshotAI/kimi-cli ⭐ 9,447 Kimi Code CLI:月之暗面命令行编码代理 +405 GitHub
11 AstrBotDevs/AstrBot ⭐ — AI Agent 助手框架,集成多个 IM 平台与 LLM,可作 OpenClaw 替代 +330 GitHub
12 moonshine-ai/moonshine ⭐ — 极低延迟语音转文字/意图识别/文字转语音,用于构建语音 Agent +264 GitHub

注:今日 GitHub Trending AI 板块延续"Agent harness + 推理优化"主线。OmniRoute(+1,300/day)首次上榜即位列第二,集成 Kimi K3 等 500+ 模型,反映多模型网关已成明确需求方向。kimi-cli 连续多日上榜(+405/day),与 Moonshot 今日 Kimi Work 桌面 Agent 形成 CLI+Desktop 双轨布局。语音 Agent(voicebox、moonshine)和代码知识图谱(code-review-graph 领跑,+1,876/day)继续霸榜。


排名 模型 参数量 下载量 描述 链接
1 thinkingmachines/Inkling 952B 13.5k Thinking Machines 首个开源多模态 MoE(连续多日霸榜,1.25k likes) HF
2 prism-ml/Ternary-Bonsai-27B-gguf 4B 339k Bonsai-27B 三值化 GGUF 量化版(847 likes,本地部署者首选) HF
3 prism-ml/Bonsai-27B-gguf 4B 1.26M Bonsai-27B GGUF 量化版(537 likes) HF
4 baidu/Unlimited-OCR 3B 2.12M 百度 Unlimited-OCR 视觉模型(2.42k likes) HF
5 zai-org/GLM-5.2 753B 532k 智谱 GLM-5.2 超大模型,多语言多模态(4.22k likes) HF
6 empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF 9B 2.12M 基于 Claude Mythos 5 蒸馏的 1M 上下文模型(2.37k likes) HF
7 conradlocke/krea2-identity-edit Krea2 身份编辑模型(约 3 小时前更新,454 likes) HF
8 HauhauCS/Qwen3.6-35B-A3B-Uncensored 35B 2.01M Qwen3.6 35B MoE 去对齐版(2.93k likes) HF
9 bottlecapai/ThinkingCap-Qwen3.6-27B 27B 10.6k Qwen3.6 思考增强版,推理能力提升(478 likes) HF
10 AngelSlim/Hy3-GGUF 295B 110k 腾讯 Hy3 GGUF 量化版(148 likes) HF

注:thinkingmachines/Inkling(952B)连续多日霸榜;三值化/量化压缩系列(Bonsai 家族、Hy3-GGUF)持续受本地部署者青睐。Qwen 3.8 为 Max 订阅制预览(非 HF 权重)、Kimi K3 权重待 7/27 发布,故均未上榜。


🚀 Product Hunt AI 热门

排名 产品 票数 描述 链接
1 Product Hunt 持续被 Cloudflare 人机验证拦截,本次自动采集仍未成功

注:Product Hunt 已连续多日被 Cloudflare 拦截。建议手动浏览 https://www.producthunt.com/topics/artificial-intelligence


📈 热度追踪

话题 持续天数 趋势 今日动态
开源大模型规模竞赛 / 中国开放权重策略 8 天 🔥🔥🔥 急升 Kimi K3 + Qwen 3.8 连续发布引发"中国开放权重反超美国闭源"叙事(HN 807 分 #1);Emerging Trajectories 深度拆解前沿实验室经济学;Qwen3.8 官方确认 2.4T 参数
GPT-5.6 / Sol 数学与安全能力 11 天 🔥🔥🔥 急升 Sol Ultra 发现 WordPress 零日漏洞链($500k 悬赏级,$25 完成);Fable 证伪 Jacobian 猜想(100 年代数几何问题);Kevin Buzzard 长文回顾"AI 反例浪潮"——从 Erdős 到 Grothendieck 到 Jacobian
Claude / Fable 5 访问与容量 5 天 ↗️ 上升 Fable 5 于 7/20 按计划纳入所有 Max 与 Team Premium 计划(昨日官宣);今日无新争议,社区注意力转向 Fable 在数学突破中的表现
编码代理 / Agent harness 44 天 🔥 急升 kimi-cli 连续多日上榜;Kimi Work 桌面 Agent 发布(桌面版 Agent 与 CLI 形成双轨);OmniRoute(多模型网关,+1,300/day)首次上榜;code-review-graph 领跑 GitHub Trending
Kimi K3 / 月之暗面 5 天 🔥 急升 Kimi Work 桌面 Agent 发布(macOS/Windows),与 K3 形成"模型+桌面"闭环;KimI K3 权重预计 7/27 上 HuggingFace
OpenAI Codex 限额 / 配额治理 2 天 ➡️ 平淡 今日无新进展(昨日上下文 372k→272k 砍档与 Codex Resets 站引爆);延续"限量供应+配额赌博"主题
模型容量 / 算力瓶颈 2 天 ↗️ 上升 Emerging Trajectories 分析:Fable 5 每任务成本是开源模型 3x;Anthropic 不拥有数据中心面临利润率天花板
AI 泡沫 / 企业落地批判 2 天 ↗️ 上升 今日无直接新内容,但 arXiv AI 写作检测(CS 65%)从学术侧提供新的视角
AI 落地副作用 5 天 ↗️ 上升 arXiv 论文 AI 写作占比(CS 65%)引发学术诚信讨论
AI for Science / 数学 11 天 🔥🔥🔥 急升 Jacobian 猜想被 Fable 证伪(100 年问题);Xena Project 博客回顾"被反例轰炸"的数学家
AI for Security 1 天 🆕 新增(急升) GPT-5.6 Sol Ultra 发现 WordPress 零日 RCE 链——"$500k 的漏洞用 $25 拿下",将 AI 能力从数学推向安全
桌面 Agent 1 天 🆕 新增 Kimi Work 桌面 Agent 发布;与"Agent harness"主线合流,标志 AI 从 Web→CLI→Desktop 的扩展
实时视频生成 1 天 🆕 新增 Vidu S1 实现 540P 25-42 FPS 实时视频,4 步扩散 + TurboServe 部署层;BestBlogs EP123 精讲
Agent 云基础设施 1 天 🆕 新增 PPIO 姚欣访谈:“Token 工厂第一客户从人变成 Agent”;日处理 1.2T Token;Agentic Cloud 架构(网关+上下文+沙箱+Harness)

📊 信源使用统计

信源等级 数量 主要信源
S 级(官方博客/公告/代码) 6 Searchlight Cyber (Adam Kues)、Moonshot AI Kimi Work 官方、Xena Project (Kevin Buzzard)、unslop.run 官方、Emerging Trajectories 官方、BestBlogs EP123
A 级(权威媒体) 2 The Verge (Robert Hart,被 werd.io 引用)、The Economist / a16z Martin Casado(被引用)
B 级(社区/社媒) 8 Hacker News(×8 热帖:807/365/265/248/177/111/93 分)、werd.io (Ben Werdmuller)、Levent Alpöge @X(经博客确认)
C 级(聚合/平台) 3 HuggingFace Trending、GitHub Trending、DeepMind Formal Conjectures 仓库

📌 本期说明:web_search(Tavily,432 错误)与 web_extract(私网拦截)继续不可用,全部信源通过浏览器直接访问 + HN Algolia API + GitHub/HuggingFace 直接访问完成交叉验证。今日 No.1 故事是 GPT-5.6 能力的多维扩展——继上周连续拿下图论猜想(CDC)与凸优化空白之后,本周 Sol Ultra 又展示了安全漏洞挖掘(WordPress 零日 RCE 链、$500k 悬赏级的漏洞用 $25 的 token 完成),而 Fable 则在代数几何 100 年未解的 Jacobian 猜想上发现反例。Kevin Buzzard 的 Xena Project 博客为这一"AI 数学浪潮"提供了权威的、贯穿 5/20-7/20 的完整时间线。No.2 故事是中国开放权重策略的战略叙事成形——Kimi K3 + Qwen 3.8 的连续发布引发 werd.io 长文(HN 807 分 #1)论证"美国正在输掉",The Verge 与 a16z Martin Casado(“80% 初创公司用中国模型”)被反复引用,Emerging Trajectories 则从经济学角度分析"模型-only 供应商"(Anthropic、月之暗面、智谱)vs “基础设施拥有者”(Alibaba、Meta、SpaceX、OpenAI)的结构性差距。No.3 故事是月之暗面的产品化闭环——Kimi K3(开放权重)→ Kimi Work(桌面 Agent)→ Kimi Code CLI 形成从模型到工具的完整链路,与本周 Qwen 3.8 的订阅制预览形成不同战略对比。值得持续跟踪:Kimi K3 权重 7/27 在 HuggingFace 发布、Sol/Fable 在安全与数学新发现上的后续验证、以及美国对中国开放权重策略的政策反应。