OpenAI 正式命名下一代模型 Astra:内部版本一次性攻破 10 项十年以上未解数学难题
🔥 今日热点 TOP 5
- 🔴 🟢 OpenAI 正式命名下一代模型 Astra:内部版本一次性攻破 10 项十年以上未解数学难题 — Altman 本周在华盛顿向参议员演示,Astra 强调多智能体长时程协作;领域横跨高维几何、群论、量子复杂度、组合学,部分问题已被推翻长期猜想 — 首次报道于 08-01
- 🔴 🟢 MiniMax H3 发布:一款模型统一文本/图像/视频/音频,原生 2K 视频 + 立体声,权重即将开源 — WAIC 2026 首发,H3-VAE 带来 4× 有效序列长度增益使原生 2K 经济可行;Artificial Analysis 视频编辑榜第一 — 首次报道于 07-31,08-01/02 全网发酵
- 🟡 字节跳动 Seedance 2.5 登顶 Hacker News:单镜头原生 30 秒视频 + 50 个多模态参考 — HN 首页 423 分 / 246 评论,原生音视频联合生成,API 经 BytePlus ModelArk 开放 — 首次报道于 08-01,08-02 登顶 HN
- 🟡 AI 公司"粉碎珍贵图书训练模型"持续发酵:ISBNdb 舆论压力下删除 AI 采书页面并宣布转向 — 404 Media 报道中间商 ISBNdb 可代采百万册,旧书因"无 AI 污染"成溢价标的;8/2 ISBNdb 撤下页面否认曾买卖图书 — 首次报道于 07-29,08-02 出现关键转折
- 🟢 Wafer AI:AMD MI355X 跑 Kimi K3 的"性价比"击败 Nvidia B300 — 8 卡 MI355X 性价比 48 tok/s/$,高于 B300 的 33;绝对吞吐 B300 仍领先,AMD 凭借显存容量与价格拿下"最清晰的推理经济学胜仗" — 首次报道于 07-31,08-02 登上 HN 首页
📰 详细资讯
1. 🔴 OpenAI 正式命名下一代模型 Astra:10 项十年未解数学难题被攻破
- 摘要:8 月 1 日,OpenAI 发布研究文章《Ten advances in mathematics and theoretical computer science》,首次正式公开下一代主力模型家族命名 Astra。一个内部版本在数学与理论计算机科学领域一次性取得 10 项进展(社区核对显示实际有 11 项取得突破),这些问题在核心结论上至少十年没有进展,多数更久。Astra 在其中"解决"了部分问题,或"推翻"了长期猜想,领域横跨高维几何、群论、量子复杂度、组合学。OpenAI 强调关键不在数学本身,而在能力如何产生——Astra 的设计核心是多个 AI 智能体在长时间内协同来完成尤其困难的任务。CEO Sam Altman 本周已在华盛顿向美国参议员与监管者演示 Astra;该模型将成为特朗普政府"发布前需联邦评估"新规下首批受审的 AI 系统之一。这是继 5 月 OpenAI 内部推理模型推翻 Erdős 1946 年"单位距离猜想"之后的又一次数学突破,但此次规模更大、且首次为模型命名。数学家 Thomas Bloom 表示"我会把它排在单位距离反例之上……就构造而言,这很重要"。需要说明:Astra 尚未公开发布,论文数据未同行评审,OpenAI 未透露模型具体耗时。
- 原文链接:https://openai.com/index/ten-advances-in-mathematics
- 信源验证:
- ✅ [OpenAI 官方] Ten advances in mathematics and theoretical computer science (https://openai.com/index/ten-advances-in-mathematics) — 发布时间: 08-01
- ✅ [The Decoder] OpenAI announces its “next major model” Astra by dropping ten previously unsolved math solutions (https://the-decoder.com/openai-announces-its-next-major-model-astra-by-dropping-ten-previously-unsolved-math-solutions) — 发布时间: 08-01
- ✅ [The Information] Exclusive: OpenAI Previews ‘Astra’ AI Model in DC (https://www.theinformation.com) — 发布时间: 07-31(Altman 参议院演示)
- ✅ [ForkLog] OpenAI Model Solves Ten Unresolved Mathematical Problems (https://forklog.com/en/openai-model-solves-ten-unresolved-mathematical-problems) — 发布时间: 08-01
- ✅ [Chosun/Upstage] OpenAI’s Astra Solves 10 Long-Standing Math, Computer Science Problems (https://www.chosun.com/english/industry-en/2026/08/02/RFK7QA7GKFE2LNXCHWCEANRPBM) — 发布时间: 08-02
- ✅ [Yellow.com] OpenAI’s Next Model Astra Just Solved 10 Problems Open For A Decade (https://yellow.com/news/openai-astra-solved-10-problems) — 发布时间: 08-01
- ✅ [Hacker News] Ten advances in mathematics… (https://news.ycombinator.com/item?id=49132058) — 发布时间: 08-01,数百评论
- ✅ [Reddit r/singularity] Ten advances in mathematics… (实际 11 项) (https://www.reddit.com/r/singularity/comments/1vcgutk/ten_advances_in_mathematics_and_theoretical) — 发布时间: 08-01
- ✅ [数学家 Thomas Bloom] “in terms of constructions, this is big” (https://x.com/thomasfbloom) — 发布时间: 08-01
- 热度指标:HN 讨论帖数百评论 / Reddit r/singularity 热议 / The Information 独家 + 多家媒体跟进
- 社媒热评:
-
“I would rank this as bigger than the unit distance counterexample. Maybe not bigger than a proof of unit distance would have been, but in terms of constructions, this is big.” — @thomasfbloom 数学家 Thomas Bloom @X
-
“At what point can we say AGI has been achieved? AI is solving mathematical problems that humans have not been able to solve for decades.” — @petilon @Hacker News
-
“Breakthrough math research is very rarely highly cited… it’s telling that OpenAI is solving random math research problems rather than bedrock algorithms and their implementation.” — @casey2 @Hacker News
-
“Open AI’s internal frontier model (Astra) was produced using only a fraction of the compute OpenAI expects to possess later next year (Early-Mid 2027).” — @r/singularity
-
- 标签:#OpenAI #Astra #AI数学 #科学发现 #多智能体 #推理模型 #AGI
- 时效性:🟢 突发 — 首次报道于 08-01,OpenAI 官方命名 Astra 并发布数学论文
2. 🔴 MiniMax H3:一款模型统一文本/图像/视频/音频,原生 2K 视频+立体声
- 摘要:MiniMax 7 月 31 日(WAIC 2026 上海)正式发布 H3——一个通用型全模态(omni-modal)生成模型。H3 不是"视频模型加插件",而是把文本、图像、视频、音频作为同一个统一上下文同时理解并生成:输出最高 2K 分辨率、单段 4–15 秒、带原生立体声的视频。它支持一张覆盖"参考+编辑"的完整能力矩阵——文生图/文生视频/文生音频之外,还支持图生图、图生视频、音生音、音视频到音视频的参考与编辑,以及多镜头建模。技术上,H 系列对 tokenizer 做了彻底重构,H3-VAE 带来 4× 有效序列长度增益,大幅压低训练与推理成本,也是原生 2K 经济可行的关键技术。权重将在未来数日内开源(受适用法律法规约束)。第三方评测中,Artificial Analysis 将 H3 列为视频编辑第一,但在文生视频/图生视频上落后于部分竞品。MiniMax 坦言当前模型规模仍有提升空间,下一代 H 系列计划整合 M 系列语言能力。
- 原文链接:https://www.minimax.io/blog/minimax-h3
- 信源验证:
- ✅ [MiniMax 官方] MiniMax H3: An Open Model Breaking the Boundaries Between Tasks and Modalities (https://www.minimax.io/blog/minimax-h3) — 发布时间: 07-31
- ✅ [MarkTechPost] MiniMax Releases MiniMax H3: An Omni-Modal Video Model (https://www.marktechpost.com/2026/08/01/minimax-releases-minimax-h3-an-omni-modal-video-model-that-generates-15-second-2k-clips-with-native-stereo-audio) — 发布时间: 08-01
- ✅ [VP Land] MiniMax H3 Unifies Text, Image, Video, and Audio Generation, with Open Weights Coming (https://www.vp-land.com/stories/minimax-h3-unifies-text-image-video-and-audio-generation-with-open-weights-coming) — 发布时间: 08-01
- ✅ [fal.ai] MiniMax H3 - Open-Weights General-Purpose Multimodal (https://fal.ai/minimax-h3) — 发布时间: 07-31
- ✅ [BestBlogs EP136] H3 全模态(08-02 早报头条)(https://www.bestblogs.dev/explore/brief/2026-08-02) — 发布时间: 08-02
- 热度指标:MarkTechPost/VP Land/fal.ai 同步发布 / BestBlogs EP136 三头条之一
- 标签:#MiniMax #H3 #全模态 #视频生成 #2K #原生音频 #开源 #WAIC2026
- 时效性:🟢 突发 — 07-31 发布,08-01/02 全网评测与发酵
3. 字节跳动 Seedance 2.5 登顶 Hacker News:原生 30 秒视频 + 50 个多模态参考
- 摘要:字节跳动新一代视频生成模型 Seedance 2.5 官方博客上线并登顶 Hacker News 首页(423 分 / 246 评论)。核心是**“一镜成片”**——单次原生生成最长 30 秒音视频(业界此前天花板约 8–15 秒,Google Gemini Omni Flash 约 10 秒),消除多段拼接导致的角色漂移与光影不一致,并支持多轮续写延长至数分钟。支持最多 50 个多模态参考(30 图 + 10 视频 + 10 音频),统一多模态音视频联合生成架构在图像、音频、动作质量上均有提升。Seedance 2.5 已在即梦(Jimeng AI)、Doubao Pro 等平台上线,API 经 BytePlus ModelArk 开放。字节用 Seedance 2.5 全程制作了一部短片《The Missing Pair》展示能力。前代 2.0 曾登顶 Artificial Analysis Video Arena 文生/图生视频双榜第一。
- 原文链接:https://seed.bytedance.com/en/blog/one-take-creation-flexible-referencing-introducing-seedance-2-5
- 信源验证:
- ✅ [字节跳动官方] One-Take Creation, Flexible Referencing: Introducing Seedance 2.5 (https://seed.bytedance.com/en/blog/one-take-creation-flexible-referencing-introducing-seedance-2-5) — 发布时间: 08-01
- ✅ [The Decoder] ByteDance’s Seedance 2.5 generates 30-second video clips with built-in audio (https://the-decoder.com/bytedances-seedance-2-5-generates-30-second-video-clips-with-built-in-audio) — 发布时间: 08-01
- ✅ [Hacker News] Seedance 2.5 — 423 points / 246 comments(首页 #1)(https://news.ycombinator.com/item?id=49130980) — 发布时间: 08-01,08-02 登顶
- ✅ [CNET] ByteDance’s New AI Video Model, Seedance 2.5, May Launch as Soon as This Week (https://www.cnet.com/tech/services-and-software/bytedance-introduces-new-seedance-2-5-video-model) — 发布时间: 07-06(规格),08-01 上线
- ✅ [MindStudio] Seedance 2.5: 30-Second Video, 4K, and 50 Multimodal References Explained (https://www.mindstudio.ai/blog/seedance-2-5-features-30-second-video-4k) — 发布时间: 08-01
- 热度指标:HN 首页 #1(423 分 / 246 评论)/ 多家评测同步发布
- 标签:#字节跳动 #Seedance #AI视频 #原生音频 #多模态参考 #一镜成片
- 时效性:🟡 跟进 — 6 月发布规格、07-31 进入企业测试,08-01 官方博客上线 + 08-02 登顶 HN 引爆讨论
4. AI 公司"粉碎珍贵图书训练模型"持续发酵:ISBNdb 撤下页面宣布转向
- 摘要:404 Media 的报道引爆了一场关于"AI 训练数据军备竞赛"的争议:AI 公司通过中间商大量采购实体旧书/珍稀书,用高速扫描机切掉书脊扫描后粉碎原件,以获取"干净、无 AI 污染"的训练数据。图书数据库公司 ISBNdb 在其网站提供"面向 LLM 训练需求、按 AI 规模交付"的批量采书服务,单笔订单可达百万册,并称"世界上最好的 AI 训练数据就在书架上",强调"前 LLM 时代的印刷书在结构上保证没有这种污染"、买家匿名。一位专营珍稀/低流通图书的卖家称自 4 月起销量激增,从每周清 20 册变成每周数百册。8 月 2 日出现关键转折:在舆论压力下,ISBNdb 删除了 AI 采书相关页面,发表声明称"从未购买、扫描或出售过用于 AI 训练的图书,也不训练 AI 模型",称该页面只是"在探索需求,我们已选择转向"。Elon Musk 公开表示反对破坏性扫描。争议焦点在于:孤本在工业规模上被销毁是否可逆。
- 原文链接:https://www.404media.co/ai-companies-are-buying-tons-of-old-books-because-theyre-free-of-ai-slop
- 信源验证:
- ✅ [404 Media] AI Companies Are Buying Tons of Old Books Because They’re Free of AI Slop (https://www.404media.co/ai-companies-are-buying-tons-of-old-books-because-theyre-free-of-ai-slop) — 发布时间: 07-29
- ✅ [Telegraph] Why AI companies are destroying millions of old books (https://www.telegraph.co.uk/news/2026/07/30/why-ai-companies-are-destroying-millions-of-old-books) — 发布时间: 07-30
- ✅ [news.com.au] AI labs quietly shred millions of rare books (https://www.news.com.au/technology/online/internet/ai-labs-buy-scan-shred-millions-of-rare-books/news-story/0c3b45a67093ab462a587a0348538ce9) — 发布时间: 07-30
- ✅ [Yahoo/ARS Technica] AI companies are anonymously buying and destroying millions of books…(含 ISBNdb 撤页更新)(https://www.yahoo.com/news/science/articles/ai-companies-anonymously-buying-destroying-214249784.html) — 发布时间: 08-01
- ✅ [Reddit r/Libraries] Company Offering Printed Books to Train AI Stops After Backlash(ISBNdb 撤页转向)(https://www.reddit.com/r/Libraries/comments/1vbtzdo/company_offering_printed_books_to_train_ai_stops) — 发布时间: 08-02
- ✅ [Dallas Express] The Vanishing Page: AI Firms Scan Then Destroy Rare Book Editions (https://dallasexpress.com/national/the-vanishing-page-ai-firms-scan-then-destroy-rare-book-editions) — 发布时间: 07-31
- 热度指标:Telegraph/news.com.au/404 Media/Yahoo 多家主流报道 / Reddit r/Libraries、r/bookbinding 讨论帖 / 新浪热点 8/2 时报收录
- 社媒热评:
-
“Once that information has been extracted and encoded into an AI model, the delivery mechanism has served its purpose… The book is not destroyed. Its value has migrated.” — ISBNdb 网站原话(引发争议)
-
“The destruction is avoidable, since machines like the Treventus ScanRobot digitize fragile books at 2,500 pages per hour without harming them, but shredding is cheaper at industrial scale.” — 社媒评论
-
- 标签:#训练数据 #版权 #AI伦理 #图书 #数据采集 #ISBNdb
- 时效性:🟡 跟进 — 核心报道 07-29/30,08-02 出现 ISBNdb 撤页转向的关键新进展
5. Wafer AI:AMD MI355X 跑 Kimi K3 的"性价比"击败 Nvidia B300
- 摘要:旧金山 AI 基础设施商 Wafer(创始人 Emilio Andere @gpuemi、Steven Arellano @gpusteve)发布技术报告:在 8 卡 AMD Instinct MI355X 上运行月之暗面 2.8 万亿参数的 Kimi K3,单位美元性能击败 Nvidia B300。这是 AMD 对 Nvidia"最清晰的推理经济学胜仗"。关键数据:MI355X 峰值聚合吞吐 952 tokens/s、单流 118 tokens/s;B300 在同测试中绝对吞吐更高(达 1,568 tokens/s)。但性价比反转——按 Wafer 假设的小时租金(MI355X $2.50、B300 $6、B200 $4.25),MI355X 为 48 tok/s/$,B300 为 33 tok/s/$,双节点 B200 仅 7 tok/s/$。Wafer 凭借 MI355X 的显存容量优势加两个软件修复缩小了 AMD 的推理差距。这反映行业趋势:前沿模型推理需求已超出 Nvidia 供应,AMD Instinct 凭借约 2.75× 的单价优势成为成本敏感推理的有力竞争者(同方法此前已用于在 MI355X 上服务 GLM-5.2)。需注意:这是 Wafer 自有测试环境数据,非独立复测。
- 原文链接:https://www.wafer.ai/blog/kimi-k3-mi355x
- 信源验证:
- ✅ [Wafer AI 官方] Running Kimi K3 on MI355X at Better Performance per Dollar Than B300 (https://www.wafer.ai/blog/kimi-k3-mi355x) — 发布时间: 07-31(作者 Ian Ye)
- ✅ [RuntimeWire] Wafer says AMD’s MI355X beats Nvidia B300 on Kimi K3 cost-efficiency (https://runtimewire.com/article/wafer-kimi-k3-amd-mi355x-b300-cost-efficiency) — 发布时间: 08-01
- ✅ [StartupFortune] AMD’s MI355X Undercuts Nvidia’s B300 on Cost to Run China’s Kimi K3 (https://startupfortune.com/amds-mi355x-undercuts-nvidias-b300-on-cost-to-run-chinas-kimi-k3) — 发布时间: 08-01
- ✅ [Hacker News] Running Kimi K3 on MI355X… — 201 points / 96 comments(首页 #5)(https://news.ycombinator.com/item?id=49141073) — 发布时间: 08-01,08-02 首页
- ✅ [SemiAnalysis InferenceX] B300 vs MI355X 基准对比(多交互区间 MI355X 更便宜)(https://inferencex.semianalysis.com/compare/kimi-k26-b300-vs-mi355x) — 持续更新
- 热度指标:HN 首页 #5(201 分 / 96 评论)/ RuntimeWire、StartupFortune 同步报道
- 标签:#AMD #MI355X #Nvidia #B300 #KimiK3 #推理经济性 #GPU #MoonshotAI
- 时效性:🟢 突发 — 07-31 技术报告发布,08-02 登上 HN 首页引发广泛讨论
6. 欧盟 AI Act 8 月 2 日正式生效:AI Office 可对 GPAI 模型开罚单、深度伪造须标注
- 摘要:2026 年 8 月 2 日,欧盟《人工智能法案》进入实质执行阶段,两大机制同时落地:(1)AI Office 对通用型 AI(GPAI)模型的执行权激活——此前只能要求文档,现在可开展技术评估、要求纠正、限制/撤回模型并开出罚款(Article 101,最高全球年营收 3% 或 €1500 万,取高者)。(2)Article 50 透明度义务即时生效——对所有在范围内的 AI 系统即时适用:交互型 AI 须告知用户在与 AI 对话;生成式 AI 须确保内容可被识别;深度伪造及涉及公共利益的 AI 生成文本须明确标注。首批 180+ 组织已签署《AI 生成内容透明度实践守则》。需注意:高风险 AI 系统的合规截止日已被 2026 年 6 月通过的 Digital Omnibus 推迟,8 月 2 日不再是高风险合规截止日(这是与旧资料最大的不同)。对系统在 8/2 前已上市的 AI 生成内容标注,有至 12 月 2 日的过渡期。
- 原文链接:https://digital-strategy.ec.europa.eu/en/news/commission-starts-enforcing-ai-act-rules-and-new-transparency-requirements-2-august
- 信源验证:
- ✅ [欧盟委员会官方] Commission starts enforcing AI Act rules and new transparency requirements on 2 August (https://digital-strategy.ec.europa.eu/en/news/commission-starts-enforcing-ai-act-rules-and-new-transparency-requirements-2-august) — 发布时间: 07-31,08-02 执行
- ✅ [ActuIA] AI Act: the countdown is on for businesses ahead of 2 August 2026 (https://www.actuia.com/en/news/ai-act-the-countdown-is-on-for-businesses-ahead-of-2-august-2026) — 发布时间: 07-31
- ✅ [Olakai] EU AI Act Enforcement: What Aug 2, 2026 Means (https://olakai.ai/blog/eu-ai-act-enforcement-august-2026) — 发布时间: 07-31
- ✅ [Accuro AI] EU AI Act: What Actually Applies on August 2, 2026 (https://accuroai.co/blog/eu-ai-act-what-actually-applies-august-2-2026) — 发布时间: 07-31
- 热度指标:欧盟官方 + 多家国际律所/合规机构同步解读(昨日预告,今日正式执行)
- 标签:#EU #AIAct #AI监管 #GPAI #透明度 #深度伪造 #罚款 #合规
- 时效性:🟢 突发 — 执行于 08-02 正式启动(昨日为预告,今日为生效日)
7. 微软 MDASH 多智能体系统:CyberGym 拿下 95.95%,断层领先所有前沿模型
- 摘要:微软的多模型智能体安全系统 MDASH 在网络安全基准 CyberGym 上以 95.95% 断层领先,比第二名 GPT-5.5 Cyber(85.6%)高出逾 10 个百分点,Mythos 5(83.8%)、GPT-5.6 Sol(83.6%)、Gemini 3.5 Flash Cyber(83.2%)紧随其后。关键洞察:MDASH 不是单一模型,而是 100+ 专业化智能体组成的流水线(由赢得 DARPA AI 网络挑战赛的团队打造),编排前沿模型与蒸馏模型并可随更强模型出现而替换。这与近期 OpenAI/Anthropic 前沿模型在网络安全评测中接连"逃逸"形成对照——在复杂、领域特定的技术工作中,模型周围的系统架构比"选哪个模型"更重要。微软 AI CEO Mustafa Suleyman 称该组合击败了 Gemini、GPT-5.5 Cyber、GPT-5.6 Sol 和 Mythos 5。MDASH 已通过 Microsoft Security Exposure Management(Defender 门户)进入私有预览,可扫描 Git 仓库、按"不太可能→已证实"排序漏洞、并用 Defender CLI 生成修复代码供开发者审核。Satya Nadella 称其"以领先模型 50% 的成本提供世界级性能"。需要说明:该成绩评估的是完整系统而非 MAI-Cyber-1-Flash 单模型,且"复现已知漏洞"与"抓到尚未编目的零日"是两回事。
- 原文链接:https://www.microsoft.com/en-us/security/blog
- 信源验证:
- ✅ [Microsoft AI / Satya Nadella] MDASH 95.95% CyberGym 官方公布 (https://x.com/satyanadella) — 发布时间: 07-27
- ✅ [Yahoo/Decrypt] Microsoft Says MDASH Beats Claude Mythos and GPT-5.6 Sol in Cybersecurity Test (https://tech.yahoo.com/cybersecurity/articles/microsoft-says-mdash-beats-claude-190104768.html) — 发布时间: 07-28
- ✅ [Rohan Paul @X] MDASH 95.95% CyberGym 技术拆解(100+ 智能体)(https://x.com/rohanpaul_ai/status/2081839571172761607) — 发布时间: 07-27
- ✅ [新智元/新浪热点] 微软 MDASH 以 95.95% 断层第一(8/2 时报收录)(https://k.sina.com.cn/article_7857201856_1d45362c001908hvx2.html) — 发布时间: 08-02
- 热度指标:新智元/新浪 8/2 热点收录 / X 多位技术博主拆解
- 社媒热评:
-
“95.95% on reproducing known vulnerabilities isn’t the same number as catching the one nobody’s cataloged yet.” — @rohanpaul_ai @X
-
- 标签:#Microsoft #MDASH #CyberGym #多智能体 #AI安全 #网络安全 #系统架构
- 时效性:🟡 跟进 — 07-27/28 官方公布,08-02 中文媒体再次聚焦;核心洞察"系统>模型"呼应本周前沿模型评测事故
8. 长时程智能体研究升温:上下文、奖励与算力的现实约束
- 摘要:BestBlogs EP136(08-02)将"长时程智能体"列为三大头条之一,反映该方向正成为 Agent 落地的核心瓶颈。近期研究集群聚焦三个现实约束:(1)上下文膨胀——AgentFold(通义实验室)用"主动上下文管理"模仿人类记忆,在超长 Web 任务中丢弃冗余、保留关键信息;MEM1 用端到端 RL 让 Agent 在长多轮任务中以"恒定记忆"运作,把记忆与推理协同进单一共享内部状态。(2)目标漂移——多项 2025-2026 论文量化了"目标漂移"机制(上下文稀释、价值冲突、从弱 Agent 轨迹继承漂移行为),把"保持目标存活且准确"列为 2026 年生产级 Agent 的定义性工程挑战。(3)奖励建模——PRInTS 等过程奖励模型为长程信息检索任务提供密集评分与轨迹摘要。这与本周 OpenAI Astra"多智能体长时程协作"、MDASH"100+ 智能体编排"形成同一主题——长时程、多智能体协调正从概念走向可测量的工程问题。
- 原文链接:https://kenhuangus.substack.com/p/agentfold-revolutionizing-long-horizon
- 信源验证:
- ✅ [BestBlogs EP136] 长时程智能体(08-02 早报头条三)(https://www.bestblogs.dev/explore/brief/2026-08-02) — 发布时间: 08-02
- ✅ [AgentFold 论文] Long-Horizon Web Agents with Proactive Context Management (arXiv:2510.24699, 通义实验室) — 发布时间: 近期
- ✅ [MEM1 论文] Learning to Synergize Memory and Reasoning for Efficient Long-Horizon Agents (https://medium.com/@sulbha.jindal/mem1-learning-to-synergize-memory-and-reasoning-for-efficient-long-horizon-agents-paper-review-0882f37d8514) — 发布时间: 近期
- ✅ [PRInTS 论文/HF] Reward Modeling for Long-Horizon Information Seeking (https://huggingface.co/papers/2511.19314) — 发布时间: 近期
- ✅ [Zylos Research] Goal Persistence and Goal Drift in Long-Horizon AI Agents(2025-2026 研究综述)(https://zylos.ai/research/2026-04-03-goal-persistence-drift-long-horizon-ai-agents) — 发布时间: 04-03(综述)
- 热度指标:BestBlogs EP136 头条 / 多篇论文与综述集中出现
- 标签:#长时程智能体 #上下文管理 #目标漂移 #过程奖励模型 #Agent #MEM1 #AgentFold
- 时效性:🔵 深度 — 研究方向综述,非单一事件驱动
🛠️ GitHub Trending AI 项目
| 排名 | 项目 | 星标 | 描述 | 今日新增 | 链接 |
|---|---|---|---|---|---|
| 1 | microsoft/AI-For-Beginners | ⭐ 58,912 | 12 周 24 课,微软官方 AI 入门课程 | +2,617 | GitHub |
| 2 | zhaoxuya520/reverse-skill | ⭐ 13,217 | 逆向/渗透/安全技能路由包,AI 自动路由+按需工具链+自进化知识库,支持 Claude Code/Cursor/Cline | +1,145 | GitHub |
| 3 | lyogavin/airllm | ⭐ 25,581 | 单张 4GB GPU 即可推理 70B 模型(分层加载) | +963 | GitHub |
| 4 | codecrafters-io/build-your-own-x | ⭐ 534,777 | 从零重造 favorite 技术来掌握编程 | +710 | GitHub |
| 5 | Panniantong/Agent-Reach | ⭐ 新晋 | 给 AI Agent 一双"看见整个互联网的眼睛"——读/搜 Twitter、Reddit、YouTube、GitHub、B站、小红书,一个 CLI,零 API 费 | +645 | GitHub |
| 6 | TencentCloud/TencentDB-Agent-Memory | ⭐ 10,800+ | 腾讯云 AI Agent 团队级记忆中枢,对话/文档/代码沉淀为四类可复用记忆资产 | +604 | GitHub |
| 7 | microsoft/generative-ai-for-beginners | ⭐ 114,717 | 21 课,微软生成式 AI 入门 | +588 | GitHub |
| 8 | usekaneo/kaneo | ⭐ 6,098 | 极简开源项目管理工具 | +491 | GitHub |
| 9 | esengine/DeepSeek-Reasonix | ⭐ 新晋 | DeepSeek 原生终端编码 Agent,围绕 prefix-cache 稳定性工程化,可常驻运行 | +389 | GitHub |
| 10 | different-ai/openwork | ⭐ 20,272 | Claude Cowork 的开源替代(基于 opencode) | +319 | GitHub |
| 11 | iv-org/invidious | ⭐ 21,950 | YouTube 替代前端 | +307 | GitHub |
| 12 | mvanhorn/last30days-skill | ⭐ 新晋 | AI Agent 技能:跨 Reddit/X/YouTube/HN/Polymarket/Web 研究任一话题并合成有据摘要 | +217 | GitHub |
| 13 | antirez/ds4 | ⭐ 新晋 | Redis 作者 Salvatore Sanfilippo 出品:DeepSeek 4 Flash/Pro 本地推理引擎(Metal/CUDA/ROCm) | +187 | GitHub |
📌 趋势观察:“Skill 路由包"生态爆发(reverse-skill +1,145、Agent-Reach +645、last30days-skill、k-skill)——为 Claude Code/Cursor 等 AI 编程客户端注入可复用技能已成热点赛道。同时 DeepSeek 本地推理(antirez/ds4、DeepSeek-Reasonix、airllm +963)持续走强。
🤗 HuggingFace Trending Models
| 排名 | 模型 | 机构 | 参数量 | 描述 | 链接 |
|---|---|---|---|---|---|
| 1 | Kimi-K3 | moonshotai | 2.8T | 持续热门的多模态模型,9.63k likes / 837k 下载 | HF |
| 2 | DeepSeek-V4-Flash-0731 | deepseek-ai | 304B | Agent 旗舰,MIT 许可,1.68k likes / 156k 下载 | HF |
| 3 | GLM-5.2 | zai-org | 753B | 智谱 GLM 系列,4.75k likes / 2.05M 下载 | HF |
| 4 | Unlimited-OCR | baidu | 3B | 百度无限制 OCR 模型,3.77k likes / 2.54M 下载 | HF |
| 5 | Qwen3.6-27B-Fable-Fusion-…-GGUF | DavidAU | 27B | Qwen3.6 社区融合量化版,1.33k likes / 1.37M 下载 | HF |
| 6 | DeepSeek-V4-Flash-0731-GGUF | unsloth | 284B | unsloth GGUF 量化版,本地部署热门,333 likes / 48.7k 下载 | HF |
| 7 | Kimi-K3-GGUF | unsloth | 2.8T | Kimi-K3 GGUF 量化版,248 likes / 88.5k 下载 | HF |
🚀 Product Hunt AI 热门
⚠️ Product Hunt 页面持续被 Cloudflare 安全验证拦截,本日数据无法自动获取。建议后续使用 RSS 或 API 替代方案。
📚 arXiv 今日精选论文
本日聚焦长时程智能体与多智能体系统方向(呼应 Astra 长时程协作、MDASH 多智能体编排)。
| 论文/方向 | 领域 | 核心贡献 | 链接 |
|---|---|---|---|
| AgentFold: Long-Horizon Web Agents with Proactive Context Management | AI Agent | 通义实验室提出主动上下文管理,模仿人类记忆在超长 Web 任务中丢弃冗余、保留关键,迈向真正自治的长程 Agent | arXiv:2510.24699 |
| MEM1: Synergize Memory and Reasoning for Efficient Long-Horizon Agents | AI Agent | 端到端 RL 让 Agent 在长多轮任务中以"恒定记忆"运作,协同记忆与推理于单一共享状态 | Medium 综述 |
| PRInTS: Reward Modeling for Long-Horizon Information Seeking | RL/Agent | 生成式过程奖励模型,为长程信息检索提供密集评分与轨迹摘要,压缩膨胀上下文 | HF Papers |
| OpenAI: Ten advances in mathematics and theoretical computer science | AI for Science | 内部模型 Astra 攻破 10 项十年未解数学难题,附推理过程 walkthrough | OpenAI |
📊 热度追踪
| 话题 | 持续天数 | 趋势 | 首次出现 |
|---|---|---|---|
| AI 科学发现 / AI 数学突破(Erdős→Astra) | 3天 | 🔥↗️ 急升(Astra 一次性 10 题引爆) | 2026-07-31 |
| DeepSeek / 中国开源模型(V4-Flash + 本地推理 + ds4) | 3天 | ↗️ 上升 | 2026-07-31 |
| AI 视频生成 / 全模态(Seedance 2.5 + MiniMax H3) | 2天 | 🔥↗️ 急升(Seedance HN #1、H3 全模态双发) | 2026-08-01 |
| Kimi / Moonshot AI(HF #1 + MI355X 推理) | 7天 | ➡️ 持续(HF Trending 榜首 + AMD 推理验证) | 2026-07-27 |
| 低成本模型推理 / GPU 经济性(MI355X vs B300、airllm) | 5天 | ↗️ 上升 | 2026-07-29 |
| AI 编程工具 / Skill 生态(reverse-skill、Agent-Reach 等) | 3天 | 🔥↗️ 急升(Skill 路由包成爆款赛道) | 2026-07-31 |
| 多智能体 / 长时程智能体(MDASH、Astra、MEM1) | 2天 | 🆕↗️ 新升(从评测安全延伸到系统架构) | 2026-08-01 |
| AI Agent 自主行为与安全(OpenAI→Anthropic→MDASH) | 7天 | ↘️ 降温但仍关注(焦点转向"系统>模型”) | 2026-07-28 |
| AI 监管 / EU AI Act 执行 | 2天 | ➡️ 持续(今日正式生效) | 2026-08-01 |
| 训练数据 / 版权伦理(珍稀图书粉碎) | 1天 | 🆕 新话题 | 2026-08-02 |
📝 信源使用统计
| 信源类型 | 引用次数 | 代表信源 |
|---|---|---|
| S级(官方) | 6 | OpenAI Research, MiniMax, 字节跳动 Seed, 欧盟委员会, Wafer AI, 微软/Satya Nadella |
| A级(媒体) | 12 | The Decoder, The Information, Chosun, MarkTechPost, VP Land, 404 Media, Telegraph, news.com.au, Yahoo/ARS, RuntimeWire, StartupFortune, 新智元/新浪 |
| B级(社区) | 7 | Hacker News(首页 #1/#5), Reddit(r/singularity、r/Libraries), X(@thomasfbloom、@rohanpaul_ai), BestBlogs EP136 |
| C级(聚合) | 4 | GitHub Trending, HuggingFace Trending, SemiAnalysis InferenceX, arXiv |
本日报由 AI 资讯研究员自动生成,数据采集于 2026-08-03 06:00 CST(UTC+8),收集 2026-08-02(周日)全天资讯。所有信息均来自公开可访问的信源,每条资讯均经过多信源交叉验证。本日头条为 OpenAI 正式命名下一代模型 Astra 并攻破 10 项十年未解数学难题(🔴 重大),以及 MiniMax H3 全模态生成模型发布。Product Hunt 因 Cloudflare 安全验证无法访问。