#工具调用
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 开源工具2026-08-24 · 周一重要度 3/5深度报告 →
only-cli/oc 0.3.0减少Agent二次命令
only-cli oc 8月23日发布0.3.0,称真实任务配对测试中会话轮次从64降到49,命令数从40降到25。
- 这条深度把它作为Agent浏览工具的工程样本处理。
- 更新把评价口径从页面token转到任务完成轮次,仍需第三方复现。
- 产品上新2026-08-11 · 周二重要度 2/5
社区发布|Needle 2将45M参数模型压至14MB
Cactus团队于窗口内在HN发布Needle 2,称45M参数经2-bit压缩为14MB,完整会话占用28MB内存;主打工具调用与结构化提取。速度与基准主要来自团队自报。
- Needle 2把端侧模型定位收窄到函数选择、参数抽取和结构化输出,以牺牲开放式生成换取极低资源占用。
- 它适合做本地动作路由器,但还不能据此替代通用小模型
- 社区工具2026-08-03 · 周一重要度 2/5
Sprocket合入代理式结账,项目仍处早期
Sprocket于北京时间8月3日03:00合入基于Prava的代理式结账工具,随后更新演示链接。采集时仓库仅3个星标,最新正式版仍是7月31日的v0.2.4。
- 让代理直接购买硬件或SaaS把工具调用推进到支付执行,也放大授权、退款与审计风险。
- 当前只有小型仓库提交和演示,不能据此判断结账可靠性。
- 产品上新2026-07-24 · 周五重要度 4/5深度报告 →
Claude 语音模式接入 Opus、Sonnet 与工具
Anthropic 于 7 月 23 日更新 Claude 语音模式,Opus 与 Sonnet 进入语音入口,具体可选模型仍跟随方案。付费方案可用全部已连接工具,Free 限一个。
- 语音模式从 Haiku 快问答扩展到复杂推理和获授权的工具动作。
- 能力提升仍受常规用量限制,工具调用也不是无确认自动执行。
- 工程复盘2026-07-13 · 周一重要度 4/5深度报告 →
HN 跟进|Ploy 迁移 GPT-5.6 后自报用时缩短约 54%
Ploy 7 月 9 日发布的迁移复盘在 7 月 12 日进入 HN 讨论。团队称完成页面的平均用时从 8 分钟降至 3 分 42 秒,缩短约 54%;数字仍未独立复现。
- 研究论文2026-07-11 · 周六重要度 4/5深度报告 →
待验证|UniClawBench:400 个真实任务把 Agent 评测推向闭环执行
UniClawBench 进入 Hugging Face Papers,提出 400 个双语真实任务;当前结果仍主要来自作者论文和项目数据。
- 研究论文2026-06-24 · 周三重要度 4/5深度报告 →
PlanBench-XL:1665 个工具的长程规划评测,前沿模型在「静默失败」前集体失灵
UIUC 团队提出交互式长程规划基准 PlanBench-XL:327 个零售任务、1665 个工具、56 种数据类型,工具需检索动态发现,平均约 25 轮、最短解 5–9 次调用。Gemini-3.1-Pro 最强(77.06%),GPT-5.4 默认 51.90% 但在最严重阻塞下崩到 11.36%,最小模型为 0%;探索度与准确率强相关(r=0.902),「静默失败」危害最大。
- 研究论文2026-06-23 · 周二重要度 4/5深度报告 →
PlanBench-XL:把前沿模型扔进 1665 个工具的「迷宫」,长程规划集体露怯
UIUC 团队提出 PlanBench-XL,用 327 个零售任务、1665 个需检索发现的工具、平均约 25 轮交互,评测 LLM 智能体在大规模工具生态下的长程规划。引入显性/隐性/误导三类工具阻塞模拟「缺失、失效、干扰」。GPT-5.4 无干扰准确率 51.90%,重度阻塞下骤降至 11.36%;Gemini-3.1-Pro 以 77.06% 领先,Qwen3-8B、Llama-3.1-8B-Instruct 为 0%。
- 这是当天最有分量的一篇:它把「agent 能不能用」的问题从单步工具调用提升到大规模工具生态 + 动态故障的真实复杂度。
- 最扎心的发现是『沉默失败最伤』