#字节跳动
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 产品上新2026-07-04 · 周六重要度 2/5
豆包 GEO skill 开源升级版:网页 + 手机 App 双端采集、截图 + XML 全记录、不绕登录——@yaojingang 7-3。
@yaojingang 7-3 发布并开源升级版豆包 AI GEO(生成式引擎优化)采集、清洗、分析 skill(获 61 赞)。三大能力:① 网页端(OpenCLI)+ 手机 App(Android Studio AVD + Appium UiAutomator2)双端采集,同一批关键词可并行取两端结果;② 手机端不只截答案,而是把截图、XML、引用资料。
- 豆包 GEO skill 开源是 GEO(Generative Engine Optimization,生成式引擎优化)赛道基础设施层的关键进展。
- GEO 是 2026 年新兴的 SEO 变体——传统 SEO 优化搜索结果排名,GEO 优化生成式 AI 回答中的内容引用。
- 模型发布2026-07-03 · 周五重要度 4/5深度报告 →
Gemini Omni Flash 在 Designarena Video Arena 以 Elo 1404 登顶:Google 视频生成自 Veo 以来累计跃升 7 位,Omni 统一架构首次把多模态塞进 Flash 档
Google DeepMind 的 Gemini Omni Flash 在 Designarena(原 LMArena)Video Arena 拿下了 Elo 1404 的榜首位置,领先第二名 BytePlus Global 的 Seedance 2.0 Mini 整整 101 Elo——Designarena 官方称这是 Video Arena 历史上最大单次跃升之一。Google 在视频生成榜上的累计排名自 Veo 系列上线以来合计 跃升了 7 位。与 Veo 时代「专模专用」(Veo 做视频、Gemini 做文本)不同,Omni Flash 是 Google DeepMind 第一个明确以「视频生成 + 多模态统一」为产品定位的 Flash 档模型——也就是说,Google 在 2026 年中把视频生成从「独立产品线」拉回到「和文本/图像/音频同一根模型栈」。这次登顶的可信度来自 Designarena 沿用的盲评投票机制(社区用户对两个匿名模型输出投票,模型名不公开),所以 Elo 1404 是用户偏好的直接结果,不是 Google 自评。
- 研究论文2026-06-22 · 周一重要度 3/5深度报告 →
PerceptionDLM:扩散语言模型实现并行区域感知,吞吐最高 3.44x 提速
来自北大与字节等机构的 PerceptionDLM(arXiv 2606.19534)首次用多模态扩散语言模型实现并行区域描述:一次去噪同时给多个掩码区域生成描述。基于 SigLIP-2 + LLaDA-8B,16 个基准中 15 个超过 LLaDA-V,自建 ParaDLC-Bench 达 62.4% 准确率,吞吐最高提速 3.44x,推理 276s(对照自回归方案 GAR 的 479s)。