字节团队找到大模型“抽风”的原因:长上下文会阶段性失忆
字节跳动 Seed 团队今年 9 月底在预印本平台 arXiv 提交了一篇论文,讨论的是分块 KV 缓存压缩带来的“相位敏感性”,直指大模型长上下文时好时坏的原因。研究评估了基础版和后训练版的 DeepSeek-V4-F…
主题标签
字节跳动 Seed 团队今年 9 月底在预印本平台 arXiv 提交了一篇论文,讨论的是分块 KV 缓存压缩带来的“相位敏感性”,直指大模型长上下文时好时坏的原因。研究评估了基础版和后训练版的 DeepSeek-V4-F…
苹果正在与硅谷初创公司PrismML进行早期洽谈,后者宣称能将大型AI模型压缩至可在iPhone上本地运行。若技术验证成功,这将强化苹果的隐私主…