#长上下文
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 模型发布2026-08-27 · 周四重要度 5/5深度报告 →
Qwen3.8-Flash-Next开源并预览Qwen4架构
Qwen 8月26日发布Qwen3.8-Flash-Next文章并更新仓库,125B主模型叠加51B N-gram embedding,每token激活6B。
- 它把长上下文成本问题拆到稀疏注意力、N-gram查表和host memory卸载。
- 官方benchmark仍是厂商自报,生态复测会决定它能否成为默认开源选择。
- 模型发布2026-08-12 · 周三重要度 3/5
NVIDIA开放Nemotron 3.5 Lightning
NVIDIA于8月11日发布Nemotron 3.5 Lightning开放模型。官方给出的规模为30B总参数、约3B激活参数,支持最长100万token上下文,并同步提供BF16与NVFP4权重;SGLang宣布首日支持。
- 小激活参数与低精度权重瞄准本地和边缘智能体的吞吐成本。
- 100万token只是容量上限,长文档检索质量、KV缓存成本和工具调用稳定性仍需独立测试。
- 研究论文2026-07-18 · 周六重要度 3/5
LongStraw 登上 HF 日榜,展示 210 万位置执行容量
LongStraw 7 月 17 日进入 HF Daily Papers,仓库同日首次公开;论文 v1 为 7 月 16 日。210 万位置结果只证明 RL 执行容量。
- 它解决的是执行图和显存管理,不是长上下文 Agent 已经训练成功。
- 作者主动写明 detached 状态和分布式路径仍不完整,这个边界比峰值数字更重要。
- 模型发布2026-07-17 · 周五重要度 5/5深度报告 →
Kimi K3 发布,开放权重承诺压到 7 月 27 前
Moonshot 在目标窗口发布 Kimi K3 官方技术说明并上线 Kimi、Kimi Work、Kimi Code 和 API。官方称模型为 2.8T 参数、100 万上下文,并承诺 7 月 27 日前开放权重。
- Kimi K3 把多模态、长上下文、代码入口和开放权重承诺放进同一发布。
- 性能数字仍主要来自发布方和社区榜单,开放权重兑现前不宜把生态影响写满。
- 研究论文2026-07-09 · 周四重要度 5/5深度报告 →
Gemma 4 技术报告上线 arXiv:开源权重扛起多模态与长上下文的新基线
Google DeepMind 把 17 页《Gemma 4 Technical Report》放到 arXiv(2607.02770);31B Dense 在 Arena 文本榜以 1451 Elo 锁定开源榜第 5、开源稠密段第 1(前 4 名均为 1T 级别 MoE),与 Gemini 3 同源,以 Apache 2.0 开放权重。
- 研究论文2026-06-24 · 周三重要度 2/5
EvoEmbedding:会随上下文「进化」的向量表征,为长上下文检索与 agent 记忆而生
现有 embedding 模型本质是静态的——孤立编码文本片段,忽略上下文和时序。EvoEmbedding 在顺序处理输入时维护一个持续更新的隐式记忆,与原始内容联合生成『可进化表征』:同一个查询会随上下文演化而检索到不同目标,超越静态语义搜索。配套 EvoTrain-180K 数据集与防表征坍缩的记忆队列,在多个长上下文检索基准上超过 Qwen3-Embedding-8B、KaLM-Embedding-Gemma3-12B 等更大模型。
- 这触及了 RAG 与 agent 记忆一个被默认忽略的假设:检索的『相关性』其实是随状态变化的。
- 同一句查询,在对话第 2 轮和第 20 轮该召回的东西可能完全不同——静态 embedding 做不到这点。