欧盟AI法进入执法期,语音代理仍在测试
欧盟委员会的AI法执法权于8月2日开始适用,透明度规则同日落地。工程侧的新增量主要来自Qwen语音前端测试、网站AI可见性审计与小型工具提交。
- 当天最重要的变化是欧盟AI法从义务说明走到可执法阶段。
- 工程项目虽有可核验增量,但多数仍处测试或早期状态,不能与正式发布同级解读。
本期速览
3 条01今日最重要:欧盟开始执法
- AI Office与成员国主管机关开始执行AI法。
02待验证:AI答案引用样本
- 自建审计称193站点中仅10个曾被点名。
03工程信号:语音前端仍在测试
- Qwen合入speech-to-speech前端及桌面集成。
编辑总结
8月2日的主线来自欧盟监管:AI法的执法权开始适用,聊天机器人、深度伪造与部分生成内容的透明度要求同步进入执行阶段。这里必须区分三组时间:GPAI义务已在2025年开始适用;2026年新增的是执法与部分透明度规则;旧模型还有2027年的合规期限。
工程侧没有同等量级的正式产品发布。Qwen Audio Agent合入可切换的speech-to-speech前端,但仓库仍把v1.3.0标为源码测试。两个小型工具项目也只构成可核验的提交信号,不代表成熟产品。
Website Auditor的第二版指数提供了一组值得追踪的样本,却不能外推为全网事实。其回答面板与机器可读性面板使用不同分母,且样本来自主动运行审计的站长;最重要的结论是应把“允许机器读取”与“进入AI答案”分开测量。
本期导航
本期重点 · 深度报告
Key Numbers
AI可见性存储审计
覆盖458个自选域名与38个检测行业,属于服务商自建样本
来源:Website Auditor快讯 · 已核验与追踪
Sprocket合入代理式结账,项目仍处早期
- Sprocket于北京时间8月3日03:00合入基于Prava的代理式结账工具,随后更新演示链接。
- 采集时仓库仅3个星标,最新正式版仍是7月31日的v0.2.4。
要点拆解展开
支付是代理从建议走向真实经济行为的高风险边界。即使项目很早期,权限设计也值得提前观察。
开发者可研究结账工具接口。企业不宜在缺少限额、确认、撤销和审计材料时授权生产支付。
- 采集时仓库星标
- 3★GitHub快照仅用于提示项目成熟度,不代表功能质量GitHub
- 最新正式版本
- v0.2.4发布于7月31日,本次代理式结账只是后续提交GitHub Releases
- 让代理直接购买硬件或SaaS把工具调用推进到支付执行,也放大授权、退款与审计风险。
- 当前只有小型仓库提交和演示,不能据此判断结账可靠性。
- 是否公开支付确认、限额与撤销机制
- 代理式结账何时进入正式Release
Codex Vision Proxy补强意图提示与粗到细观察
Codex Vision Proxy在窗口内移除缺少对照数据的关键词路由,改由助手最近意图生成看图提示,并加入局部放大、像素取色和渲染差分方法。
要点拆解展开
纯文本代理调用视觉工具时,提示与复核流程会直接影响误读率。可逐提交审查的方法变化提供了工程样本。
Agent工具作者可复用粗到细观察与像素级复核思路。生产采用前仍需验证成本、延迟和跨图像类型表现。
- 采集时仓库星标
- 197★GitHub快照,只代表关注度,不证明方法效果GitHub
- 意图提示提交时间
- 21:49北京时间8月2日,提交f043f6eGitHub
- 这组提交把视觉代理的可靠性问题拆成意图、定位与确定性测量。
- 项目只有作者经验和局部测试,方法收益仍需统一评测验证。
- 是否发布统一图像任务评测与对照数据
- 移除关键词路由后错误类型是否减少
8月3日观点跟进|Gary Marcus质疑Astra能力外推
Gary Marcus于北京时间8月3日发布评论,肯定Astra数学结果值得关注,同时质疑精选案例能否支持通用智能或可靠科研能力的更强结论。
要点拆解展开
前一日Astra成果容易被压缩成单一能力叙事。反方观点帮助补上成功率、筛选过程与迁移能力的证据缺口。
研究者可把争议转化为候选池、失败率与独立复核问题。产品买方仍没有Astra访问范围、价格或稳定性信息。
- OpenAI公开成果
- 10项8月1日官方精选结果,属于背景,不是8月3日新增成果OpenAI
- 窗口内新增的是一篇外部评论,不是Astra发布或新增评测。
- 它的价值在于提醒读者区分可核查数学成果、精选成功案例与通用能力外推。
- OpenAI是否披露候选问题总量与失败案例
- 数学界能否独立复核十项结果
社交雷达 · X 讨论
- Vercel 的 Guillermo Rauch 介绍公司内部运营 Agent「v」:日常工作已覆盖财务、沟通、文档、营销、工程与商业分析,并按用户保存记忆、工作流和日程。
- 他强调企业应掌握从源码、运行时、数据到 token 的完整控制权。
原帖 ↗- Nous Research 与 Novita Labs 合作,将 DeepSeek V4 Flash 0731 在 Nous Portal 的价格下调 90%,活动持续 7 天。
- 官方称,在可比任务上,折后价格比 Fable 5 低逾 1000 倍,同时 Terminal-Bench 2.1 成绩更高。
原帖 ↗OpenCode 称,DeepSeek Flash 在 8 月 1 日处理了 8 万亿 token,其中 5 万亿来自免费使用,另有 3 万亿来自 OpenCode Go 套餐。
原帖 ↗- 黄瑞腾开源长程 Agent 系统 LoopX,披露两条分别持续 220.7 小时和 272.9 小时的真实运行轨迹。
- 项目通过外置目标、任务门、权限、证据、调度和恢复状态,支持跨执行、等待、人工决策与恢复继续推进。
原帖 ↗- AstroHanRay 称
- 同为 DeepSeek V4 Flash 时
- Maka 在 Terminal-Bench 2.1 全套89题通过61题
- OpenCode通过49题
原帖 ↗QingQ77 介绍 qwen-audio-agent 的全双工语音运行时:前台 Agent 可边听、边答、边执行,工具调用或长任务交给后台 Agent,完成后再把结果送回同一段对话。
原帖 ↗更多讨论4 条
- Suu766 推荐开源项目 reverse-skill:把 APK
- 网页代码与固件逆向中的分析顺序和工具选择封装为可加载 Skill,可用于 Codex
- Cursor 或 Claude Code,尝试把依赖个人经验的逆向流程交给 Agent 执行。
原帖 ↗gkxspace 分享 Codex 多 Agent 配置方法:让 Sol 留在主线程规划,再以独立上下文调用 Luna Max 子 Agent 执行边界明确的任务,并提醒先检查本地 Codex 版本对配置格式的兼容性。
原帖 ↗_FORAB 转述万宝盛华研究称,随着企业使用 AI 筛选简历,有求职者用极小的白色字体嵌入「直接推进候选人」等指令,试图对招聘筛选系统实施提示词注入。
原帖 ↗- Thariq(@trq212)认为,数学领域已经出现杰文斯悖论:AI 让更多研究发生、理解门槛降低,也让数学从业者能用更高抽象层次与公众讨论
- 他预计,对具备数学思考与知识的人才需求反而会上升。
原帖 ↗