#多模态
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 模型评测2026-08-26 · 周三重要度 2/5
待验证|Qwen3.8登开源图生网页榜首
Arena 8月25日称Qwen3.8-27B在Image-to-WebDev Arena列开源模型第1、总榜第7,并给出1574分和27B参数口径。
- 这是有用的榜单信号,但今天主要来自Arena和Qwen的X传播。
- 早报把它降级处理,原因是榜单页面可见排名有限,完整项目变动仍需官方榜单或可复现实验补强。
- 研究论文2026-08-25 · 周二重要度 3/5
8月24日跟进|OmniAssistBench登HF日榜
Hugging Face 8月24日把OmniAssistBench列入Daily Papers;论文8月21日提交,目标是评测实时视频助手的多轮交互能力。
- 新闻点是社区策展和项目页更新,论文首发日期仍是8月21日。
- 它值得保留,因为指标从被动视频理解转向模型建议会改变用户后续动作的交互场景。
- 模型发布2026-08-22 · 周六重要度 3/5深度报告 →
少源|DeepSeek上线视觉实验模型
DeepSeek 8月21日称V4-Flash-Vision-Exp已上线API;非X文档证实接口和限额,benchmark仍待第三方验证。
- 这条更像API能力补齐而非旗舰模型换代。
- 它值得记录,是因为DeepSeek把视觉输入
- 行业动态2026-08-13 · 周四重要度 4/5
德国组织投诉Meta AI眼镜涉嫌违法录制
德国人权组织HateAid于8月12日宣布,已向法兰克福总检察院提交针对Meta及相关AI眼镜销售方的刑事投诉,主张设备可能违反隐私和录音相关法律。投诉不等于检方已立案或违法事实成立。
- 可穿戴AI的合规对象不只包括用户数据,也包括镜头前不知情的第三人。
- 若执法推进,默认录制、指示灯和人工审核链路都可能成为产品设计约束。
- 模型发布2026-08-13 · 周四重要度 5/5深度报告 →
xAI发布Grok 4.6,主攻长时智能体任务
xAI于8月12日发布Grok 4.6,重点从单轮能力推进到多步骤研究、代码库操作和视觉制品。第三方Artificial Analysis给出61分,与GPT-5.6 Sol同分;同分只限其九项综合指数。
- xAI把升级重点从单轮回答移到持续执行和可交付制品。
- 第三方指数提供了横向参照,但厂商与评测机构的结果仍需要真实长程任务复现。
- 研究论文2026-08-12 · 周三重要度 4/5
Google让AMIE进入实时视频会诊模拟
Google Research于8月11日披露AMIE实时视频会诊研究。在100个模拟病例中,30名初级保健医生与15名标准化患者演员参与比较;团队称视频版AMIE在多项会诊质量指标上优于文字版,但尚未用于真实临床。
- 从文字问诊进入同步视频,使模型面对语速、表情和检查指导等更真实的沟通变量。
- 模拟OSCE可以验证交互能力,却不能替代真实患者安全、偏差和临床结果评估。
- 产品上新2026-08-08 · 周六重要度 4/5深度报告 →
Seedance 2.5 API上线火山方舟
火山引擎于8月7日宣布Seedance 2.5 API上线。30秒单段视频和最多50个参考素材是7月31日已公布的模型能力;当天增量是服务状态从“近期上线”变为可用。
- API上线把视频模型从产品入口推进到可编排的开发接口,但公开文档仍缺模型ID、价格和海外区域清单。
- 报道必须把既有能力与当天交付状态分开,避免把30秒误写成再次提高。
- 模型发布2026-07-31 · 周五重要度 4/5深度报告 →
Thinking Machines 发布 Inkling-Small 开放权重模型
Thinking Machines 正式开放 Inkling-Small 权重。该 MoE 有 2760 亿总参数、每个 token 激活 120 亿参数,接受文本、图像与音频输入。
- 本次增量是把 7 月 15 日的预告转成可部署权重。
- 更小的激活规模降低推理门槛,但模型质量、显存需求与许可边界仍要独立核验。
- 研究评测2026-07-28 · 周二重要度 4/5深度报告 →
Kimi发布PerceptionBench,榜首准确率59.7%
Kimi发布PerceptionBench并开放代码与数据入口,从42个基准的失败中归纳10类原子视觉能力,构造3000道题。代码仓库为Apache-2.0,数据卡标记CC BY-NC 4.0。
- 它试图把“看错”与“推理错”拆开,避免知识和推理掩盖感知短板。
- 榜单由发布团队自建,题目筛选与泄漏风险仍需第三方检查。
- 研究论文2026-07-18 · 周六重要度 4/5深度报告 →
VideoChat3 登顶 HF 日榜,4B 模型与数据页更新
VideoChat3 于 7 月 17 日成为 Hugging Face 日榜第 1。团队同步更新 4B 模型、训练仓库和三套视频数据资源。
这条的价值在完整开放承诺和跨通用、长视频、流式场景的统一设计。性能结论仍主要来自作者评测。
- 模型发布2026-07-17 · 周五重要度 5/5深度报告 →
Kimi K3 发布,开放权重承诺压到 7 月 27 前
Moonshot 在目标窗口发布 Kimi K3 官方技术说明并上线 Kimi、Kimi Work、Kimi Code 和 API。官方称模型为 2.8T 参数、100 万上下文,并承诺 7 月 27 日前开放权重。
- Kimi K3 把多模态、长上下文、代码入口和开放权重承诺放进同一发布。
- 性能数字仍主要来自发布方和社区榜单,开放权重兑现前不宜把生态影响写满。
- 模型发布2026-07-16 · 周四重要度 4/5深度报告 →
Thinking Machines Lab 发布 Inkling 全量权重
Thinking Machines Lab 7 月 15 日发布 Inkling:975B 总参数、41B 激活的多模态 MoE,预训练量为 45T tokens,并开放 Apache-2.0 全量权重。
- Inkling 的差异不只是接近 1T 参数,而是把可控推理力度、多模态输入与可微调权重放在同一底座。
- 性能仍主要来自发布方评测。
- 研究论文2026-07-11 · 周六重要度 4/5深度报告 →
待验证|UniClawBench:400 个真实任务把 Agent 评测推向闭环执行
UniClawBench 进入 Hugging Face Papers,提出 400 个双语真实任务;当前结果仍主要来自作者论文和项目数据。
- Agent 评测正在从静态答题转向可执行环境。
- 真正重要的是它把失败原因拆成技能使用、探索、长上下文、多模态和跨平台协同五类能力。
- 研究论文2026-07-11 · 周六重要度 4/5深度报告 →
待验证|Vidu S1:实时语音控制把视频生成推向交互模式
Vidu S1 进入 Hugging Face Papers;论文称可用语音实时控制数字角色,42 FPS 仍属团队自测口径。
- 这条线索的意义不是又一个视频模型,而是交互范式变化。
- 视频生成从离线 prompt 出片,转向可持续、可打断、可语音控制的 live session。
- 模型发布2026-07-09 · 周四重要度 5/5深度报告 →
GPT-Live 全双工接管 ChatGPT Voice:语音前台加 GPT-5.5 后台
OpenAI 7 月 8 日发布 GPT-Live 全双工语音模型,作为 ChatGPT Voice 新底层引擎。今日起在全球 iOS、Android、Web 端推送,API 即将上线。
- 研究论文2026-07-09 · 周四重要度 5/5深度报告 →
Gemma 4 技术报告上线 arXiv:开源权重扛起多模态与长上下文的新基线
Google DeepMind 把 17 页《Gemma 4 Technical Report》放到 arXiv(2607.02770);31B Dense 在 Arena 文本榜以 1451 Elo 锁定开源榜第 5、开源稠密段第 1(前 4 名均为 1T 级别 MoE),与 Gemini 3 同源,以 Apache 2.0 开放权重。
- 模型发布2026-07-08 · 周三重要度 3/5深度报告 →
待验证|Qwen 3 旗舰多模态预告:480B MoE 与 1M 上下文仍需确认
Qwen 官方 X 与团队负责人在 7 月 7 日给出 480B 总参、32B 激活 MoE、四模态、1M 上下文和约 67% 降价口径。非 X 页面缺少当天日期锚点,本期按发展中预告处理。
- 这条可能重要,但证据还不够。
- 参数和价格来自官方社媒,ModelScope 与百炼页面没有清晰发布日期
- 模型发布2026-07-08 · 周三重要度 5/5深度报告 →
Meta 发布 Muse Image 和 Muse Video:图像 Arena 第二,视频 Arena 第三
Meta 发布 Muse Image 与 Muse Video。Muse Image 在 Image Arena 总榜和三项子榜均列第二;Muse Video 以 1459 分列 Video Arena 第三。更重要的是,Muse Image 采用工具调用、自我修正和推理预算扩展。
- Meta 把图像生成从一次出图推向可迭代流程:模型会调用工具、检查中间结果并继续修改。
- 真正的新意不是榜单排名,而是把图像模型做成可运行的工作流。
- 产品上新2026-07-07 · 周二重要度 4/5深度报告 →
待验证|Claude Code 学会看视频:1.2k Star 的本地 FFmpeg 方案,把多模态缺口补成了一段命令行
开源工具 claude-real-video 用 FFmpeg 场景检测与 Whisper 转写,把任意 URL 或本地视频拆成 LLM 可读的关键帧与文本。GitHub 累计 1.2k Star,并上过 Hacker News 首页。对 Claude Code 而言,这等于把“看视频”补到了本地工作流级别。
- 1200 Star 投下的是『Claude 多模态视频缺口是真实需求』,这件事的工程意义不在 FFmpeg 抽帧参数本身,而在它把『视频到 frames 与 transcript 与 manifest』做成可被 Agent 在循环里反复调用的 skill。
- 这把『模型每升一代,流水线自动获益』直接写进了 repo 的接口形状。
- 产品上新2026-07-06 · 周一重要度 3/5深度报告 →
claude-real-video:把视频“翻译”成 Claude 能读的文件夹
开源 Python 工具用场景感知抽帧+音频转写,把视频压成 5–15 张关键帧+字幕文本,喂给任何不支持原生视频的 LLM;GitHub 24 小时内冲到 936 星、登 HN 首页(165 分/56 评),但评论区对“为什么不直接用 Gemini”吵成两派。
- 工具的真正价值不在技术而在把多模态缺口的体感变成一个 30 行的可执行命令。
- 和 Gemini 原生视频的关系不是替代而是分场景并存——crv 覆盖本地、隐私、Claude Code 生态绑定这条窄路。
- 研究论文2026-06-24 · 周三重要度 2/5
待验证|DataClaw0:把「数据处理」变成可学习的 agent 能力,从原始流裁剪多模态数据
清华等提出『Agentic Data Tailoring』:不再被动标注,而是主动把高熵的非结构化多模态流裁剪成与用户/下游意图对齐的结构化输出。用『确定性事实锚点 + 生成式语义合成』两阶段流水线造数据,基于 9B 模型 SFT + GRPO 联合训练,并用下游后训练(视频生成、真实 VQA、GUI 导航)作为最终验证标尺,而非只看中间指标。
- 这反映了一个正在成形的判断:数据工程本身正在被『agent 化』。
- 把数据裁剪从一次性预处理变成可学习、可奖励优化的能力,意味着『为下游任务定制数据』可以闭环训练。
- 研究论文2026-06-23 · 周二重要度 2/5
待验证|BioMatrix:序列-结构-语言统一的生物基座,80 任务里 77 项 SOTA
上海 AI Lab 等提出 BioMatrix,称是首个在单一 decoder-only 架构内原生融合『序列、结构、语言』、同时覆盖分子与蛋白质的多模态生物基座。通过统一 tokenization 把 SMILES/SELFIES、分子结构、蛋白序列/结构与语言映射到共享离散 token 空间,统一 next-token 预测,无需外部编码器或模态专用输出头。基于 Qwen3(1.7B/4B)持续预训练 3044 亿 token,在 6 类 80 个任务上 77 项达 SOTA 或有竞争力。提交者于 6 月 23 日提交。
- AI for Science 的一个值得记的方向:把生物多模态统一进一个『纯语言模型式』的 token 空间,省掉适配器和专用头,理论上能让分子与蛋白之间的跨模态生成更自然。
- 77/80 SOTA 的说法很亮眼,但置信度需谨慎
- 研究论文2026-06-23 · 周二重要度 3/5
DataClaw0:把『数据处理』变成可学习的 agent 能力,从原始流裁剪多模态数据
清华等提出『Agentic Data Tailoring』:不再被动标注,而是主动把高熵的非结构化多模态流裁剪成与用户意图对齐的结构化输出。基于 Qwen3.5-9B,SFT + GRPO 联合训练,两阶段流水线(自底向上抽取『事实锚点』+ 自顶向下语义合成),分 Omni(统一)与 Expert(领域解耦)两种范式。DataClaw0-val 上 Field 最高 97.53,接近 Gemini-3.1-Pro-Preview 的 98.12。
- 这反映了一个正在成形的判断:数据工程本身正在被『agent 化』。
- 把数据裁剪从一次性预处理变成可学习、可奖励优化的能力,意味着『为下游任务定制数据』可以闭环训练。
- 研究论文2026-06-23 · 周二重要度 3/5深度报告 →
PerceptionDLM:用扩散语言模型并行做区域感知,吞吐最高提速 3.44×
北大、ByteDance、武大、CASIA、NUS 的工作,首次用多模态扩散语言模型(DLM)实现并行区域描述——不再逐个区域自回归处理,而是用结构化注意力掩码让多个掩码区域同时被描述。基于 SigLIP-2 + LLaDA-8B,提出 ParaDLC-Bench(2345 题、GPT-5.2 评判)。多模态 16 项基准 15 项超 LLaDA-V,ParaDLC-Bench 准确率 62.4%(LLaDA-V 35.2%),完全并行时吞吐最高提速 3.44×,单图延迟从 10.04s 降到 2.92s。
- 扩散语言模型一直被质疑『只快不准』,这篇用区域感知这个天然可并行的任务给出了反例:既显著超越扩散基线,又把自回归逐区域的延迟砍掉近 7 成。
- 它的价值在于点明了 DLM 的差异化战场——凡是输出之间相互独立、可并行的结构化感知任务,DLM 的并行解码就有结构性优势。
- 研究论文2026-06-22 · 周一重要度 3/5深度报告 →
PerceptionDLM:扩散语言模型实现并行区域感知,吞吐最高 3.44x 提速
来自北大与字节等机构的 PerceptionDLM(arXiv 2606.19534)首次用多模态扩散语言模型实现并行区域描述:一次去噪同时给多个掩码区域生成描述。基于 SigLIP-2 + LLaDA-8B,16 个基准中 15 个超过 LLaDA-V,自建 ParaDLC-Bench 达 62.4% 准确率,吞吐最高提速 3.44x,推理 276s(对照自回归方案 GAR 的 479s)。
- 这是扩散语言模型(DLM)在多模态感知上对自回归路线的一次正面挑战:AR 逐区域处理的串行瓶颈,被 DLM 的并行解码天然化解。
- 意义在于为『密集区域级理解』(检测、指代、密集描述)提供了一条不靠堆 token 数、而靠并行解码提效的新路径。