最新一期第 42 期 · 共 6 条信号
2026年8月3日
周一 · 过去 24 小时的 AI 世界

欧盟AI法进入执法期,语音代理仍在测试

欧盟委员会的AI法执法权于8月2日开始适用,透明度规则同日落地。工程侧的新增量主要来自Qwen语音前端测试、网站AI可见性审计与小型工具提交。

本期判断
  • 当天最重要的变化是欧盟AI法从义务说明走到可执法阶段。
  • 工程项目虽有可核验增量,但多数仍处测试或早期状态,不能与正式发布同级解读。

本期速览

3 条
  1. 01今日最重要:欧盟开始执法
    • AI Office与成员国主管机关开始执行AI法。
  2. 02待验证:AI答案引用样本
    • 自建审计称193站点中仅10个曾被点名。
  3. 03工程信号:语音前端仍在测试
    • Qwen合入speech-to-speech前端及桌面集成。

编辑总结

8月2日的主线来自欧盟监管:AI法的执法权开始适用,聊天机器人、深度伪造与部分生成内容的透明度要求同步进入执行阶段。这里必须区分三组时间:GPAI义务已在2025年开始适用;2026年新增的是执法与部分透明度规则;旧模型还有2027年的合规期限。

工程侧没有同等量级的正式产品发布。Qwen Audio Agent合入可切换的speech-to-speech前端,但仓库仍把v1.3.0标为源码测试。两个小型工具项目也只构成可核验的提交信号,不代表成熟产品。

Website Auditor的第二版指数提供了一组值得追踪的样本,却不能外推为全网事实。其回答面板与机器可读性面板使用不同分母,且样本来自主动运行审计的站长;最重要的结论是应把“允许机器读取”与“进入AI答案”分开测量。

On this page

本期导航

Deep Dives

本期重点 · 深度报告

3 篇

Key Numbers

透明度准则签署组织

欧盟委员会8月2日公告所列首批签署组织,不等于全部受监管主体

来源:欧盟委员会 →
超过180家

AI可见性存储审计

覆盖458个自选域名与38个检测行业,属于服务商自建样本

来源:Website Auditor
531次

Sprocket仓库星标

采集时GitHub快照,提示项目成熟度仍早期,不用于评价功能质量

来源:GitHub →
3★
Briefs

快讯 · 已核验与追踪

3 条
社区工具重要度 2/5高置信官方源

Sprocket合入代理式结账,项目仍处早期

  • Sprocket于北京时间8月3日03:00合入基于Prava的代理式结账工具,随后更新演示链接。
  • 采集时仓库仅3个星标,最新正式版仍是7月31日的v0.2.4。
要点拆解展开
Why

支付是代理从建议走向真实经济行为的高风险边界。即使项目很早期,权限设计也值得提前观察。

Impact

开发者可研究结账工具接口。企业不宜在缺少限额、确认、撤销和审计材料时授权生产支付。

Numbers
采集时仓库星标
3★GitHub快照仅用于提示项目成熟度,不代表功能质量GitHub
最新正式版本
v0.2.4发布于7月31日,本次代理式结账只是后续提交GitHub Releases
早报判断
  • 让代理直接购买硬件或SaaS把工具调用推进到支付执行,也放大授权、退款与审计风险。
  • 当前只有小型仓库提交和演示,不能据此判断结账可靠性。
接下来看
  • 是否公开支付确认、限额与撤销机制
  • 代理式结账何时进入正式Release
#Sprocket#代理支付#工具调用#Show HN
社区工具重要度 2/5高置信官方源

Codex Vision Proxy补强意图提示与粗到细观察

Codex Vision Proxy在窗口内移除缺少对照数据的关键词路由,改由助手最近意图生成看图提示,并加入局部放大、像素取色和渲染差分方法。

要点拆解展开
Why

纯文本代理调用视觉工具时,提示与复核流程会直接影响误读率。可逐提交审查的方法变化提供了工程样本。

Impact

Agent工具作者可复用粗到细观察与像素级复核思路。生产采用前仍需验证成本、延迟和跨图像类型表现。

Numbers
采集时仓库星标
197★GitHub快照,只代表关注度,不证明方法效果GitHub
意图提示提交时间
21:49北京时间8月2日,提交f043f6eGitHub
早报判断
  • 这组提交把视觉代理的可靠性问题拆成意图、定位与确定性测量。
  • 项目只有作者经验和局部测试,方法收益仍需统一评测验证。
接下来看
  • 是否发布统一图像任务评测与对照数据
  • 移除关键词路由后错误类型是否减少
#Codex#视觉工具#Agent#图像理解
观点观察重要度 1/5中置信多源混合

8月3日观点跟进|Gary Marcus质疑Astra能力外推

Gary Marcus于北京时间8月3日发布评论,肯定Astra数学结果值得关注,同时质疑精选案例能否支持通用智能或可靠科研能力的更强结论。

要点拆解展开
Why

前一日Astra成果容易被压缩成单一能力叙事。反方观点帮助补上成功率、筛选过程与迁移能力的证据缺口。

Impact

研究者可把争议转化为候选池、失败率与独立复核问题。产品买方仍没有Astra访问范围、价格或稳定性信息。

Numbers
OpenAI公开成果
10项8月1日官方精选结果,属于背景,不是8月3日新增成果OpenAI
早报判断
  • 窗口内新增的是一篇外部评论,不是Astra发布或新增评测。
  • 它的价值在于提醒读者区分可核查数学成果、精选成功案例与通用能力外推。
接下来看
  • OpenAI是否披露候选问题总量与失败案例
  • 数学界能否独立复核十项结果
#Gary Marcus#Astra#数学推理#观点
Social Radar

社交雷达 · X 讨论

6 条
rauchg@rauchg176 likes
  • Vercel 的 Guillermo Rauch 介绍公司内部运营 Agent「v」:日常工作已覆盖财务、沟通、文档、营销、工程与商业分析,并按用户保存记忆、工作流和日程。
  • 他强调企业应掌握从源码、运行时、数据到 token 的完整控制权。
原帖 ↗
NousResearch@NousResearch1997 likes
  • Nous Research 与 Novita Labs 合作,将 DeepSeek V4 Flash 0731 在 Nous Portal 的价格下调 90%,活动持续 7 天。
  • 官方称,在可比任务上,折后价格比 Fable 5 低逾 1000 倍,同时 Terminal-Bench 2.1 成绩更高。
原帖 ↗
opencode@opencode2517 likes

OpenCode 称,DeepSeek Flash 在 8 月 1 日处理了 8 万亿 token,其中 5 万亿来自免费使用,另有 3 万亿来自 OpenCode Go 套餐。

原帖 ↗
huangruiteng@huangruiteng57 likes
  • 黄瑞腾开源长程 Agent 系统 LoopX,披露两条分别持续 220.7 小时和 272.9 小时的真实运行轨迹。
  • 项目通过外置目标、任务门、权限、证据、调度和恢复状态,支持跨执行、等待、人工决策与恢复继续推进。
原帖 ↗
AstroHanRay@AstroHanRay137 likes
  • AstroHanRay 称
  • 同为 DeepSeek V4 Flash 时
  • Maka 在 Terminal-Bench 2.1 全套89题通过61题
  • OpenCode通过49题
原帖 ↗
QingQ77@QingQ7719 likes

QingQ77 介绍 qwen-audio-agent 的全双工语音运行时:前台 Agent 可边听、边答、边执行,工具调用或长任务交给后台 Agent,完成后再把结果送回同一段对话。

原帖 ↗
更多讨论4 条
Suu766@Suu7661603 likes
  • Suu766 推荐开源项目 reverse-skill:把 APK
  • 网页代码与固件逆向中的分析顺序和工具选择封装为可加载 Skill,可用于 Codex
  • Cursor 或 Claude Code,尝试把依赖个人经验的逆向流程交给 Agent 执行。
原帖 ↗
gkxspace@gkxspace662 likes

gkxspace 分享 Codex 多 Agent 配置方法:让 Sol 留在主线程规划,再以独立上下文调用 Luna Max 子 Agent 执行边界明确的任务,并提醒先检查本地 Codex 版本对配置格式的兼容性。

Tz_2022
  • Tz_2022 提议把 Luna Max 配成 Codex 专用子 Agent,由 Sol 负责主线程统筹,Luna 处理范围明确
  • 可独立完成的子任务。
原帖 ↗
_FORAB@_FORAB541 likes

_FORAB 转述万宝盛华研究称,随着企业使用 AI 筛选简历,有求职者用极小的白色字体嵌入「直接推进候选人」等指令,试图对招聘筛选系统实施提示词注入。

原帖 ↗
trq212@trq212859 likes
  • Thariq(@trq212)认为,数学领域已经出现杰文斯悖论:AI 让更多研究发生、理解门槛降低,也让数学从业者能用更高抽象层次与公众讨论
  • 他预计,对具备数学思考与知识的人才需求反而会上升。
原帖 ↗
Previous Editions

往期早报

全部归档 →