跳到文章正文
DeepSeek 编辑推荐

DeepSeek 又招人:甩出 DSec 沙盒技术报告,38 万沙盒同时在线

招聘通常靠岗位 JD,DeepSeek 这次直接甩了一篇技术报告。标题很硬核:《DeepSeek…

招聘通常靠岗位 JD,DeepSeek 这次直接甩了一篇技术报告。标题很硬核:《DeepSeek 弹性计算(DSec):面向大规模 Agent 训练的沙盒基础设施》。潜台词大概是:活太多,得招人。

报告里的数字很有说服力。DeepSeek 一套 DSec 扩展分片,大约有 160 台服务器、3 万个 CPU 核心和 250TB 内存,每天要服务约 300 万个沙盒;高峰期同时在线的沙盒超过 38 万个,每秒还能创建 5000 多个。而他们已经把这样的分片在生产环境部署了多个。

一分钟速览

  • DeepSeek 弹性计算团队大规模招人,尤其缺资深工程师
  • 一套 DSec 分片:约 160 台服务器、3 万 CPU 核心、250TB 内存
  • 每天服务约 300 万个沙盒,高峰同时在线超 38 万个
  • 镜像按需加载让创建任务提速约 1.71 倍,磁盘写入减少约 57%
  • 资源超卖率已超 50 倍,内存共享让宿主机峰值内存下降 40.2%

为什么 Agent 训练需要专门的“沙盒”

DSec 是支撑 DeepSeek-V4 全部训练、评测和数据预处理流程的沙盒基础设施,从 DeepSeek-V3.2 一路到 V4.1,Agent 训练、评测和数据预处理产生的全部沙盒负载都跑在它上面。它面对的工作负载和普通云计算不太一样:Agent 训练时,模型要不断进入真实环境执行任务——读代码、改文件、装依赖、跑测试、起服务,每一步都会改变当前环境,下一轮交互还要接着前面的状态继续。因此这些沙盒既要能快速、大批量创建,又不能每执行一步就销毁重来。

DeepSeek 把这类负载的特点总结得很清楚:创建请求会突然集中涌入;CPU 大部分时间空闲,但为了保存文件和进程,内存得一直留着;不同任务所需环境差异很大;基础镜像复用率不高;训练还可能因 GPU 资源被抢占而中断。

把环境拆成三层,按需加载

面对上述特点,DSec 的大部分工作就是压低“每个 Agent 环境”的供给成本。首先是环境本身:DeepSeek 统计 2026 年某一周的生产数据发现,仅 Container 后端就用到了 11266 个基础镜像、102171 个工作区以及数百个工具包。若按传统做法,每种组合都做成完整镜像,代码或工具包一更新就可能重建一大批。DSec 因此把环境拆成三层:操作系统和基础软件放进 base image,任务代码和依赖放进 workspace,Harness 这类工具单独做成 toolkit,三者分别管理版本,创建沙盒时再组合。

环境拆开后还有镜像分发的问题。DeepSeek 查看了真实生产数据,发现根本没必要提前全量拉取:Agent 实际访问到的数据只占整个镜像的 4.2% 到 13.3%。于是镜像数据被统一放到自研的 3FS 分布式文件系统,本地主要保存元数据,需要某块数据时再按需读取。集中创建 8192 个 Container 的测试显示,先拉完整镜像需要 60 多分钟,改为按需加载后缩短到约 35 分钟,提速约 1.71 倍,磁盘写入量同时减少约 57%。另一组工作区实验里,从“每个沙盒解压一份 tar.gz”改成直接挂载 EROFS 层后,整个任务从 79 分钟缩短到 45 分钟,磁盘写入总量只剩原来的约五分之一。

90% 的沙盒,CPU 用量不到申请的 5%

环境供给解决后,下一步是把 CPU 和内存尽可能利用起来。DeepSeek 发现 Agent 沙盒其实相当“稀疏”:大约 90% 的沙盒,平均 CPU 使用量都不到申请资源的 5%。原因是 Agent 完成一次操作后通常要等模型生成下一步动作,等待期间 CPU 基本闲置,但文件、进程等环境状态仍需保存,内存又不能释放。这给 DSec 留下很大的调度空间,目前生产环境的资源超卖率已经超过 50 倍。

但单纯往一台机器塞更多沙盒还不够。MicroVM 之间大量相同的只读内容如果各存一份,内存很快会成瓶颈。DSec 通过 virtio-pmem 和 DAX,让同一宿主机上的 MicroVM 共享宿主页缓存,单独启用这项机制,实验中宿主机峰值内存占用相比基线下降 40.2%;再借助 DAMON 和 balloon 空闲页报告回收暂时不用的内存,按时间累计的内存消耗还能再降低 21.2%。CPU 方面也不能一视同仁:DSec 优先保证时延敏感任务,再让时延要求低的任务利用剩余 CPU,实验显示当节点其他任务已占掉 50% CPU 容量时,时延敏感任务受到的延迟影响从 45.2% 降到 17.3%。

用 Agent 给 Agent 造环境

这些优化的目的都很一致:尽可能压低每个 Agent 环境占用的资源,把同一批机器撑出更大的并发规模。DSec 目前统一支持四种执行后端:FnCall、Container、MicroVM 和 Full VM,分别覆盖在线评测等短任务、软件工程与工具调用、更强隔离,以及支持 GUI、图形渲染甚至 Android 应用的完整操作系统。随着 Agent 能力外扩,环境会越来越复杂,DeepSeek 接下来还打算把 Agent 能训练的环境一起铺开——用 Agent 给 Agent 造环境。

趋势洞察

这已经是 DeepSeek 三周内的又一轮招聘。技术报告泄露出一个信号:当行业还在比模型跑分时,真正拉开差距的可能是“训练与评测的工业底座”。谁能以更低成本同时跑起几十万个 Agent 环境,谁就能更快地迭代模型。DSec 把超卖、内存共享和按需镜像这些云计算的成熟思路用到了 Agent 训练上,这套“降本打法”比任何一个新模型都更值得同行研究。

本文地址:https://www.163264.com/16155