DGX Spark 三模型实测 · 2026-09-29–30(Europe/Dublin);离线整理于 2026-09-30 来源:用户提供的实验日志包,只使用 RUN_INDEX 指定的四次正式运行。历史目录排除。 A:40 种完成测量的模型、输入长度与并发组合,120 轮、276 条请求。每种配置重复测量三次,每次同步提交对应数量的请求(1、2 或 4 条)。 B:三个模型各一组,同一输入连续请求三次,共 9 条;不是五对独立实验。 合计:285 条完成请求,129 轮记录。Qwen3.6 中断时另有两份未形成完成记录的流式事件,排除。 固定输出 1024 tokens,temperature=0,ignore_eos=true,enable_thinking=false。 输入长度包括各自 chat template;合成重复材料,不用于质量评估。 服务开启 prefix caching。A 每个请求使用独立的请求级隔离值,276 条 cached tokens 均为 0。 B 组内请求共用新的隔离值:首次命中 0,之后按 API usage 记录实际命中。 无独立客户端预热;服务内部预热和正式推理时 JIT 不因此排除。 测试按输入长度、并发顺序执行,没有随机化。没有全程独占负载证据。 TTFT:请求开始至首个非空正文文本到达,包括排队、输入处理和流传输。 decode TPS:API completion tokens / (流结束 - 首个非空文本),分子包含首包 tokens。 端到端耗时:请求开始至流结束。 整轮输出吞吐:本轮输出 tokens 总和 / (最后结束 - 最早开始)。不能用单请求 TPS 相加替代。 A 默认展示:先平均轮内请求,再对三轮取算术平均;三轮请求数相等。 每种配置的范围:三次轮级均值的最小值与最大值,不是置信区间。 分组点图按输入长度划分横向区域,横轴为所选指标(对数或线性刻度),每个区域的纵向为单请求 decode 速度,右侧统一使用 0–200 tok/s 刻度。颜色区分模型,圆形、方形、三角形对应并发 1、2、4;同一输入长度、同一模型的并发点依次连接。每个点为三轮均值,悬停查看数值与范围;只纳入完整轮。未完成/未测均为 null,不填零、不画点,状态保留在可下载的原始数据中。 B 每个气泡为单次请求;延迟节省和加速比相对于该模型同组首次请求,共享基线,不作独立配对统计。 外部干扰 unknown 不代表已发现干扰,也不表示已证明无干扰。 数据校验:重算 285 条请求的时间及 TPS;129 轮的请求归属、输出数、时长、吞吐及提交偏差; 核对每次流的首正文时间、输出 token 计数和 length 完成原因,共 64998 个事件; 最终 usage-only 事件未落盘,缓存明细使用逐请求记录中的最终 usage,无法从 SSE 文件独立还原缓存明细。 重算 42 个原汇总格;将三模型绑定到正式请求前最近的实际启动日志并核对共同配置。 公开 CSV/JSON 仅保留必要测量字段,生成文本、隔离值、原始内部运行标识和私有路径均不包含。