Qwen3-235B 金融微调 Accuracy
桥水加 Thinking Machines Tinker 平台,基线 GPT-5、Claude 4.8 错误率高 29.8%
来源:FeitengLi 解读 →今天的主线不是某个新模型发布,而是工作流层与商业侧的两个拐点同时显现。
一是 Fable 5 的红利从单点对话渗透到工作流层:Berman 公开双 $200 订阅的 Planning/Execution 分工,开发者共识收敛为「Fable 做诊断、Codex 做执行」。但 Superpowers 6.0 的提速应归因于评审流重写,不是 Fable 5 接入。头部用户正在主动编排模型角色,也需要更严格的事实核查。
二是 高价闭源模型的「无限定价权」叙事出现拐点:LLM Token 单价 6 月从近 $2 回落到 $1.6–$1.7,低价模型吃掉执行端,OpenAI 联合 Broadcom 发布自研推理芯片 Jalapeño 守住成本护城河。真正要看的是 7–9 月 OpenAI、Anthropic 的 ARR 是否低于线性外推。
三是 垂直 AI 路径首次被华尔街量化兑现:桥水在 Thinking Machines 的 Tinker 平台上用 Qwen3-235B 跑出金融微调 Accuracy 84.7%,证明「开源底座加专家数据加针对性微调」这条路可以在金融场景真实落地。
桥水加 Thinking Machines Tinker 平台,基线 GPT-5、Claude 4.8 错误率高 29.8%
来源:FeitengLi 解读 →Extra High 档单次任务,含 2600 栋建筑与 27 家科技公司总部
来源:FinanceYF5 推文Anthropic 用中立社区平台背书 Fable 5 生成能力,首次出现社区评测等同官方背书的转换。
代表 AI 营销可信度的负面锚点,影响所有「AI 快速完成」类宣传的接受度。
开源工具用 Playwright 加多模态大模型做闲鱼多任务实时监控:Web 可视化后台、AI 自然语言建监控任务、多任务并发加价格与区域过滤、多账号代理池轮换、Cron 定时、多渠道推送、Docker 一键部署。
代表 Agent 工具从开发辅助扩展到商业流程自动化。
代表 frontier 模型差异化战场从基准分数转向任务分工。
开发者:订阅加工作流编排成头部用户标配。模型厂商:差异化战场转向任务分工而非总分。
vikingmute 用 AI 设计两个应用首页得出五步流程:搜集好看设计参考、PRD 加参考截图喂 AI 精炼展示内容、ChatGPT images-2 出 3 种风格、转页面微调、用 GASP 或 motion 加小动画。
代表「AI 让设计民主化」叙事的反方样本。
设计师:AI 设计工具从「替代」转向「素材生成」。创业者:设计仍是壁垒。设计工具:差异化战场在微调工作流。
jamesob 维护的 jamesob、local-llm 仓库 738★,系统整理本地运行 LLM 的硬件选型、模型量化、推理框架、显存调优,是当下最完整的本地 LLM 攻略。
代表本地 LLM 攻略从零散博客走向系统化工程资料。
开发者:本地 LLM 部署门槛系统性下降。企业:隐私合规场景的可行选项增加。
HUANGCHIHHUNGLeo、claude-real-video 仓库 730★,实现 Claude 真正观看视频:场景感知切帧、去重、转写,通过 MCP 把视频帧与转写一起喂给 Claude,实现视频问答。
代表 MCP 加多模态组合填补 frontier 模型 API 缺口的工程化范式。
开发者:视频问答门槛系统性下降。Anthropic:是否考虑推出原生视频 API 仍待观察。
SuperJJ007、CSSwitch 仓库 218★,一键把 Claude Code 切换到 DeepSeek、Qwen、GLM、Kimi、硅基流动、OpenRouter 等任意 OpenAI·Anthropic 兼容 API 端点,无需改 Claude Code 源码。
代表 Claude Code 协议开放性被开发者社区工具化兑现。
开发者:Claude Code 工作流可接任意后端模型。Anthropic:协议层而非模型层成为新壁垒。
代表 MCP 生态进入需要可观测性的成熟阶段。
MCP Server 开发者:调试效率提升。企业:可审计 MCP 调用成为合规要求。
代表 AI 内容工业化向质感化的拐点。
以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。
代表当下 ML 圈「蒸馏刷指标」的讽刺样本,影响所有「超越 Fable」类蒸馏报告的接受度。
huang_chao4969 开源的 OpenOPC 是一套 AI-native 公司自运行框架:Self-Built 自动实例化角色化 AI 员工,Self-Run 用结构化任务分配加同行评审编排多 Agent,Self-Grown 把每次任务沉淀为可复用组织知识。
代表 Agent-native 公司框架从概念走向工程化。
社交雷达 · X 讨论
- 桥水在 Thinking Machines 的 Tinker 平台发报告:拿 Qwen3-235B 做金融微调,Accuracy 84.7%,错误率比 GPT-5
- Claude 4.8 低 29.8%,推理成本降 13.8 倍。
- 值得看的是「开源底座加专家数据加针对性微调」这条垂直 AI 路线正被华尔街验证。
原帖 ↗- 本人每月 $200 订 Fable
- $200 订 GPT-5.5,今天落地一套分工:Fable 负责 Planning
- GPT-5.5 负责 Execution,依据是 theo 分享的 CLAUDE.md。
- theo 实测此前约 50% 的端到端 agent PR 会被自己关掉,搭这套后当天一个没关。
原帖 ↗- Gorden_Sun 把 Superpowers 6.0 提速归因于 Fable 5。
- 对照 GitHub release notes,提速来自评审流重写
- README 与 release notes 未提 Fable。
- 值得看:二手标题需要标成待核实,不能直接写成结论。
原帖 ↗- 教程贴:把 Claude Code 路由到 Microsoft Foundry 即可绕过 5 小时上限。
- 一是用 Azure 免费 $200 信用(学生 $2000)部署 Claude Sonnet 5 走 Foundry 端点转发。
- 二是只需配三行环境变量。
- 值得看:5 小时限制是 r/ClaudeAI 吐槽最多的痛点,但信用 30 天过期。
原帖 ↗- 梗但有料:一个团队拿 230 万条 Fable 5 reasoning traces 蒸馏 Qwen3-4B,号称 100% self-consistency
- 0.00 bits 输出熵。
- 真相是清洗脚本 bug 把所有答案替换成了「Egypt won.」,学生模型收敛的唯一真理就是它。
- 原文以正经论文体裁写成,讽刺 ML 圈一窝蜂蒸馏刷指标。
原帖 ↗- 吐槽贴:ammaar 宣称用 Fable 5 把 2003 年 EA《命令与征服:将军》原生移植到 iPhone、iPad。
- dotey 翻 commit 发现:ammaar 只贡献最近 19 个,其余 2000 个全是开源项目 GeneralsX 自 2025 年 2 月起的积累。
- 值得看:AI 独立完成大型移植水分很大,约 1% 是 AI 写的。
原帖 ↗更多讨论8 条
- 硬数据:LLM Token Expenditure Index 6 月明显回落,5 月底最高近 $2 每百万,6 月快速回落到 $1.6–$1.7。
- 一是企业 workflow 转向 planning 用高价、execution 走低价。
- 二是看 7–9 月 OpenAI、Anthropic ARR 是否低于线性外推。
原帖 ↗- 介绍 OpenOPC:一个开源 AI-native 公司自运行框架。
- 一是 Self-Built 自动实例化角色化 AI 员工。
- 二是 Self-Run 用结构化任务分配、同行评审、闭环执行编排多 Agent。
原帖 ↗- 开源工具:基于 Playwright 加多模态大模型的闲鱼多任务实时监控系统。
- 一是 Web 可视化后台配置任务与账号。
- 二是 AI 能自然语言输入需求、识别商品图、看卖家画像建监控任务。
原帖 ↗- 案例:有人用 Fable 5 的 Extra High 档生成了一个旧金山 3D 地图。
- 一是金门大桥、2600 栋建筑、渡轮、雾气全在内,还标出 27 家科技公司总部位置。
- 二是单次任务消耗约 2000 万 tokens。
原帖 ↗- 提示词心得:让 AI 视频不像 AI 的秘诀是「做旧」。
- 一是主体锁死发型衣着,环境写实到晾衣绳电线,摄影机加手持抖动、跑焦、曝光跳变模拟千禧年 DV 质感。
- 二是音效只留环境音,结尾突然被掐断像随手关了摄像机。
原帖 ↗- 工作流复盘:用 AI 设计两个应用首页,结论是设计仍是最大护城河、微调设计比写代码难。
- 一是搜集好看设计取 design.md。
- 二是 PRD 加参考截图喂 AI 精炼展示内容与结构。
原帖 ↗- 体验贴:PDD 30 元的 Type-C 4G 随身网卡,插 SIM 后用 opencode 五分钟搞定 VID
- PID 修改和 ECM usbnet 模式切换。
- 一是外接后识别为有线网卡、能正常上网。
原帖 ↗- 短评:Fable 查 bug 能力明显强于 Codex,能发现 Codex 解决不掉的问题。
- 一是作者没给具体 case,但确认 Fable 在诊断与根因定位上更深。
- 二是顺带提到 zvec 这个新向量数据库性能优秀但兼容性 bug 多。
原帖 ↗