#Harness
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 开源工具2026-08-14 · 周五重要度 4/5深度报告 →
DeepSeek Harness预览开源插件化agent框架
DeepSeek在8月13日开放Harness v0.1开发者预览,并在GitHub公开MIT仓库。同日commit发布dsh@0.1.0-rc.5,仍非GA稳定版。
- DeepSeek从模型API向执行框架外扩。
- 影响力取决于插件生态、沙盒安全和与现有LangChain、Codex类工具的互操作,首日星标只说明开发者关注度。
- 研究评测2026-07-30 · 周四重要度 4/5深度报告 →
官方单源|OpenAI 两项设置让 ARC-AGI-3 得分近三倍
OpenAI 官方单源称,同一 GPT-5.6 Sol 在 ARC-AGI-3 公开任务集上,得分由 13.3% 升至 38.3%,输出 token 约减少 6 倍。
- 增量来自评测 harness,而非模型权重更新。
- 核心数字尚无独立复现,当前只能说明上下文保留与截断策略可能显著影响长程评测。
- 观点观察2026-07-28 · 周二重要度 2/5
GitHub给出Copilot Harness四阶段工作流
GitHub 7月27日发布实践文章,把Copilot开发流程拆成原型、计划、实现与审查四阶段,并称CLI、Copilot app、VS Code等入口正集中到同一Harness。
- 这篇文章给出官方工作方法,并未发布Copilot新功能。
- 它把Agent使用从提示词技巧推进到可重复流程,证据仍主要来自作者经验而非团队效率实验。
- 观点观察2026-06-27 · 周六深度报告 →
智能体渗透工作三方对账:99.8% 渗透率与 1.6 倍吞吐之间的鸿沟
OpenAI 内部报告显示 Codex 占每周输出 token 从 2025 年 8 月不足 10% 升至 99.8%,80.6% 员工发起过等效人类超 30 分钟的请求、25.6% 超 8 小时,非开发者用量个体涨 137 倍、组织涨 189 倍,法务/财务/招聘 4 月跨过使用过半拐点;Anthropic 经济影响研究(逐小时采样)显示近半受访者预期 12 个月内职责显著变化,不到 10% 自认会失业但超三分之一估计初级同事失业概率高于 60%;字节洪定坤分享 TRAE 团队半年超 90% 代码由 AI 生成,人均吞吐却只提升约 1.6 倍,引入 Harness(上下文工程/架构约束/团队知识沉淀)后可交付性从 40-60 分升至约 80 分。三方数据拼出一个完整图景:智能体『用』已无争议,『用好』还差很远,瓶颈正从模型能力转移到工程化交付。
- 研究论文2026-06-24 · 周三重要度 4/5深度报告 →
EnterpriseClawBench:用真实职场会话造基准,最强 agent 也只过 0.766
一个从专有真实 agent 会话蒸馏出的企业级基准:5291 条原始任务实例经自动化流水线收敛成 852 个可复现任务。全集最强 GPT-5.5 仅 0.766,Lite 子集顶分只有 0.663,远未饱和。核心发现是 agent 表现高度依赖 harness 而非只看模型——Claude 系在 Hermes 运行时从 0.62-0.64 骤降到 0.458。
- 研究论文2026-06-23 · 周二重要度 5/5深度报告 →
EnterpriseClawBench:把 5291 条真实职场会话变成评测,给 Claude Code、Codex 直接打分
该基准从真实企业 agent 会话中提炼出 852 个可复现任务(含 120 题人工审核的 Lite 子集),用『硬规则 + 五维语义评判』双层打分,评测了 32 个 harness-模型组合(Claude Code、Codex、DeepAgents、Hermes、OpenClaw)。因含内部内容,数据不公开,公开的是构建与评测协议。最佳 Lite 成绩仅 0.663(Codex+GPT-5.5),全集 DeepAgents 上 GPT-5.5=0.766、Sonnet 4.6=0.749、Haiku 4.5=0.632。
- 它补上了 agent 评测最稀缺的一环:真实办公场景而非合成任务。
- 两个判断值得划重点:其一,harness 影响巨大