性能证据
Power 只接受仍然保留执行契约的性能优化。因此,公开的 Qwen3.8 记录通过真实流式 API 测量,固定制品与二进制身份,校验确定性输出,并同时报告质量、工作负载吞吐与稳态解码速度。
本页记录的是一个后端、模型与硬件组合,不是推理引擎的适用范围。Power 的执行、准入、内存、取消与证据契约保持模型中立,同样服务于视觉、OCR、嵌入、音频、多模态、科学计算和调用方自有的已审查图。
想直接验证数字,可进入复现实验:先运行无需模型的单命令验真,再按同一输入身份完成 RTX 4090 全流程复跑。
各模式质量与速度
当前验收只测试未改动的 Q6_K 目标模型。表中的 Q4 文件只作为外部推测解码 proposal,不作为目标模型评分;混合量化和 Q8 记录属于历史研究,不进入当前 验收表。
6 个轮次都完成 100/100 请求,零错误,并通过持续的逐进程 GPU 独占校验。 两种模式各自在三轮中完全稳定。跨模式时,MTP 保留 89/100 个提取答案和 50/100 个完整输出摘要;宽松评分有 2 个收益、2 个损失,严格评分为 0 个收益、 2 个损失。因此它更快,但不是无损默认模式。
“请求全程”包含提示词处理、生成、HTTP 和请求开销,不等同于预热后的 1,024-token 稳态解码。无需模型或 GPU 即可验证 纯 Q6_K 证据包。
已归档的辅助 proposal 研究
只使用 Q6_K 目标的 DFlash2 边界
DFlash2 的两种配对模式始终加载同一个 22,884,408,288 字节 Q6_K GGUF。 1.14 GB 的 Q4 文件只负责生成 proposal,从未作为目标模型计分;这组记录 不包含 Q4 目标结果。
原生 Power 的五次受控配对结果如下:
解码提升 4.367 倍,请求全程提升 2.454 倍。五次配对输出完全一致,proposal 接受率为 98.230%,回放为零。这是整数序列上的高接受率边界,不是稳定 175 token/s,也不能代表通用对话、Coding、RAG 或 Agent 吞吐。
固定 12 题 MMLU、GSM8K 与 C-Eval 校准按交叉顺序重复三轮。两种模式每轮 都是宽松 9/12、严格 9/12,提取答案 12/12 一致,但完整响应摘要只有 7/12 一致。请求全程吞吐均值从 29.702 提高到 45.143 token/s,提升 1.520 倍;候选 三轮为 54.586、33.689 与 47.155 token/s。DFlash2 已能原生运行,但仍是显式 配置,不是无损默认值。仓库提供了 完整报告、离线校验器与复现命令。
外部 DSpark 的实测边界
峰值采集保持 Q6_K 目标字节不变,另加载 1.10 GB 的 DSpark Q4 proposal 模型。固定 K10/S6 的三次稳态结果为 169.561、167.102 和 169.324 token/s,相对 32.249 token/s 的配对目标对照提升 5.250 倍;proposal 接受率为 90.873%,每次目标前向提交 9.8077 个 token,回放为零。
另一组 600 请求质量采集固定 100 道 MMLU、GSM8K 与 C-Eval 题目,每种模式重复三次,使用 1,024 context 和 batch 12。目标对照为宽松 67/100、严格 58/100、22.618 token/s;DSpark 为 73/100、59/100、32.678 token/s,吞吐提升 1.445 倍。两种模式各自完全稳定,但跨模式只有 54/100 个完整输出逐字一致,而且每个 DSpark 请求都进入过精确回放路径。因此没有观察到分数下降,但 K10/S6 未通过无损生产默认门槛,仍是显式基准配置。
当前按请求工作的控制器不再直接从宽 K10 开始,而是先做一次可完整回滚的 K6 探测。首轮全部接受才开启 K10;只要首轮部分接受,就在该请求中关闭宽路径;连续低收益则单向切回目标模型。在干净提交 cbdb3f673446b3532c9683dabc816a149ae27b1f 上,三次受控峰值为 166.988、160.881 和 164.756 token/s。中位数 164.756、最低 160.881 均通过 160 token/s 门槛,输出与回执摘要一致;接受率 92.713%,每次目标前向提交 9.8077 个 token,回放为零。
自适应 100 题采集为 31.052 token/s,对照为 22.872 token/s,提升 1.358 倍。接受率 62.878%,每次目标前向提交 3.373 个 token;24 个请求单向切回目标模型,没有回放或防护触发。宽松/严格分数从 67/58 变为 69/56;配对结果包含 5 个宽松收益、3 个宽松损失、1 个严格收益和 3 个严格损失,提取答案一致 89/100,完整输出一致 55/100。双方都未截断的 57 题答案一致。
随后用哈希锁定的 5 题集合复测了全部宽松或严格损失,并加入 1 道正向对照。512-token 配置交叉运行 3 轮,每轮都是 5/5 配对答案一致、0 收益、0 损失,吞吐为 30.521 对 24.967 token/s。把预算提高到 1,024 token 后,5 题全部正常结束;两种模式都是 4/5,未截断答案 5/5 一致。因此,256-token 矩阵中的表面损失与截断位置有关,没有在更长预算下复现为答案回退。跨模式完整输出仍为 0/5 一致,所以结论只覆盖这组损失样本:它不是通用智力证明、175 token/s 服务下限或逐字输出默认配置。
DFlash v1 不包含在上述数字中。它与 DSpark 使用不同的制品契约,不能叠加; 本机尚无真正的 DFlash v1 GGUF 通过验收。上面的原生 DFlash2 使用另一套契约, 两者不能混用。
原始 Q6_K 执行路径案例
原始 22,884,408,288 字节 Q6_K 制品没有重新量化。最新精确构建复跑使用固定 K7/S6/B11、8,192 行 draft-only token-ID 前缀、短批量 Flash Attention 关闭、普通 CUDA Graph、高优先级 CUDA stream、完整 CUDA offload、物理核亲和性与单模型/单请求调度。9 个 1,024-token 样本的稳态中位数为 174.413 token/s,最低 172.723,输出摘要完全一致;这次结果没有建立稳定 175 token/s 下限。
较安静主机上较早的同制品高水位仍为 176.6109 token/s,最低 173.263;其 20.13% 提升参照是全词表 K7/S7 的 147.0207 token/s。两次都是峰值工作形状边界,不是共享桌面的服务保证。
通用短任务配置使用固定 K6/S6/B8。当前 12 题、256-token 配对采集达到 46.923 token/s;目标模型串行对照为 28.713 token/s,提升 63.42%。Proposal 接受率为 26.81%,但每次目标前向仍提交 2.591 个已验证 token,且回放为零。
从第一性原理看,吞吐约等于每次目标前向提交的 token 数,除以 draft、目标校验、同步和采样成本。峰值提示词已经达到 96.64% 接受率和每次目标前向 7.75 个 token,完美接受率只剩约 3.2% 理论空间;共享 WDDM 争用已成为当前稳定 175 的主要边界。
负结果同样保留:关闭 CUDA Graph 只有 133.876 token/s;GGML_CUDA_GRAPH_OPT=1 为 160.613;CUDA_DEVICE_MAX_CONNECTIONS=32 为 168.900。较早的无约束自适应 K 实验把代表性负载接受率提高到 50.07%,却因形状变化破坏图复用而降至 35.178 token/s。Flash Attention 因此按配置启用,而不是全局开关。
这套结论属于一个 llama.cpp/CUDA 集成,不是服务下限,也不是通用默认值。Power 提供的是有限形状、调度、精确回退和证据契约;其他后端与模型必须重新选择自己的形状和内核。
当前验收主机为 Windows 11、RTX 4090 与 10 核 20 线程 Intel Xeon w5-2445。0x55555 亲和性掩码与该机器拓扑绑定,不是可移植的产品默认值。
智力水平下降了吗?
当前纯 Q6_K 矩阵的宽松分数保持 67/100,严格格式分数从 60/100 降到 58/100。MTP 有 2 个宽松收益、2 个宽松损失,提取答案一致 89/100,完整输出 一致 50/100;双方都未截断的 59 题保持相同提取答案。因此,这组固定样本没有 出现宽松总分下降,但不能证明智力不变或逐字无损,生产默认门槛仍然关闭。
固定 DSpark 的跨领域矩阵没有观察到分数下降:宽松 73/100、严格 59/100,对照为 67/100 与 58/100;但完整输出一致率只有 54/100。新的自适应采集让宽松分数提高 2 分、严格分数降低 2 分,并出现 3 个配对宽松损失;双方都未截断的 57 题答案一致。512/1,024-token 的 5 题复测没有复现这些答案损失,且在 1,024 token 下实现 5/5 未截断答案一致,但这只是针对损失样本的诊断。完整输出仍为 0/5 一致,逐字输出生产门槛继续关闭,也不能把固定任务分数解释为通用智力。
当前原始 Q6_K K6/S6/B8 配对校准中,12 个最终答案一致,两种模式都是宽松 9/12、严格 9/12,8/12 完整内容摘要一致,双方各有 3 题触及 256-token 上限。批量与串行目标内核会产生不同浮点轨迹,因此精确目标校验不承诺逐字节响应一致。
DFlash2 校准中两种模式同样都是 9/12,提取答案 12/12 一致,但完整响应摘要 只有 7/12 一致。因此只能说这组小样本没有观察到分数下降,不能证明通用智力 等价或逐字无损。
这个样本仍不足以判断通用智力。目标模型精确校验能证明每个提交 token 由目标模型裁决,但不能取代代表性质量测试。
复现边界
独立复现页给出了可复制命令、固定环境、输入 SHA-256、完整 runner 参数、输出文件与通过条件。
完整复验分为两层:
- 离线验证:无需加载模型,重新计算归档报告的统计值、哈希、门槛与输出身份。
- 性能复跑:重建固定的 CUDA 配置,校验精确制品、提示词、ACL 和二进制,再通过 Power 流式 API 执行工作负载。
当前干净采集固定为 1 次预热、9 次实测、每请求生成 1,024 token、batch 11、greedy 采样、高优先级 CUDA stream 与确定性输出 SHA-256。模型身份、后端、输出长度、摘要、主机控制或显式门槛任一不符,runner 都会失败。离线校验器固定 23 个证据哈希,并重新计算当前与历史统计值。
仓库已提交完整步骤与原始证据:
- Windows/CUDA 完整复现步骤
- 基准记录与所有模式解读
- 原始 Q6_K 边界与动态量化分析
- 100 题重复质量协议
- DSpark 峰值、质量证据与精确复现
- 只使用 Q6_K 目标的 DFlash2 证据与精确复现
- 自适应 DSpark 峰值与配对质量证据
更换芯片、驱动、显示负载、时钟策略、模型字节或提示词后,应将结果视为一次新实验,不能静默合并进本次验收记录。
