For AI agents: the complete documentation index is available at https://a3s-lab.github.io/Power/v1.0.0/llms.txt, the full documentation bundle is available at https://a3s-lab.github.io/Power/v1.0.0/llms-full.txt, and this page is available as Markdown at https://a3s-lab.github.io/Power/v1.0.0/performance.md.
  • 简体中文
  • v1.0.0
  • 性能证据

    Power 只接受仍然保留执行契约的性能优化。因此,公开的 Qwen3.8 记录通过真实流式 API 测量,固定制品与二进制身份,校验确定性输出,并同时报告质量、工作负载吞吐与稳态解码速度。

    本页记录的是一个后端、模型与硬件组合,不是推理引擎的适用范围。Power 的执行、准入、内存、取消与证据契约保持模型中立,同样服务于视觉、OCR、嵌入、音频、多模态、科学计算和调用方自有的已审查图。

    想直接验证数字,可进入复现实验:先运行无需模型的单命令验真,再按同一输入身份完成 RTX 4090 全流程复跑。

    各模式质量与速度

    当前 Qwen3.8-27B Q6_K 模式固定 100 题分数,3 轮均值请求全程吞吐三轮范围
    原始 Q6_K,自回归对照宽松 67/100;严格 60/10023.642 token/s23.543--23.832
    同一 Q6_K,全词表 MTP宽松 67/100;严格 58/10041.035 token/s(1.736 倍)40.197--41.696

    6 个轮次都完成 100/100 请求,零错误,并通过持续的逐进程 GPU 独占校验。两种模式各自在三轮中完全稳定;跨模式时,MTP 保留 89/100 个提取答案和 50/100 个完整输出摘要,严格格式分数从 60/100 降到 58/100,因此不是无损生产默认模式。

    “请求全程”包含提示词处理、生成、HTTP 和请求开销,不等同于预热后的 1,024-token 稳态解码。无需模型或 GPU 即可验证纯 Q6_K 证据包

    已归档的辅助 proposal 研究

    只使用 Q6_K 目标的原生 DFlash2 边界

    两种模式都保留同一份 22,884,408,288 字节 Q6_K 目标。1.14 GB Q4 DFlash2 制品只负责 proposal,每个提交 token 仍由 Q6_K 校验。

    相同 Q6_K 目标解码中位数解码最低值请求全程中位数
    目标直解33.075 token/s32.938 token/s25.744 token/s
    DFlash2 K7/S6144.453 token/s141.267 token/s63.182 token/s

    解码提升 4.367 倍,请求全程提升 2.454 倍。五次配对输出一致,接受率 98.230%,回放为零。代表性 12 题质量校准保留 12/12 提取答案,但完整输出只 一致 7/12。因此 DFlash2 是原生可选配置,不是无损默认值,也没有建立稳定 175 token/s 下限。

    外部 DSpark 的实测边界

    峰值采集保持 Q6_K 目标字节不变,另加载 1.10 GB 的 DSpark Q4 proposal 模型。固定 K10/S6 的三次稳态结果为 169.561、167.102 和 169.324 token/s,相对 32.249 token/s 的配对目标对照提升 5.250 倍;proposal 接受率为 90.873%,每次目标前向提交 9.8077 个 token,回放为零。

    另一组 600 请求质量采集固定 100 道 MMLU、GSM8K 与 C-Eval 题目,每种模式重复三次,使用 1,024 context 和 batch 12。目标对照为宽松 67/100、严格 58/100、22.618 token/s;DSpark 为 73/100、59/100、32.678 token/s,吞吐提升 1.445 倍。两种模式各自完全稳定,但跨模式只有 54/100 个完整输出逐字一致,而且每个 DSpark 请求都进入过精确回放路径。因此没有观察到分数下降,但 K10/S6 未通过无损生产默认门槛,仍是显式基准配置。

    DFlash v1 不包含在上述数字中。它与 DSpark 使用不同的制品契约,不能叠加;本机尚无真正的 DFlash v1 GGUF 通过验收。DFlash2 是上面单独列出的原生采集。

    原始 Q6_K 的峰值边界

    最新精确构建复跑保持原始 22,884,408,288 字节 Q6_K 制品不变,使用前缀 FR8192 K7/S6 后,9 个 1,024-token 样本的稳态中位数为 174.413 token/s,最低 172.723,所有输出摘要一致;它没有建立稳定 175 token/s 下限。较安静主机上的较早记录为 176.6109 token/s 中位数、173.263 最低值;两者都不是服务保证。

    模型权重没有重新量化。速度来自原生 MTP、目标模型精确校验、8,192 行 draft-only token-ID 前缀、6 份驻留循环状态快照、GPU 批量 greedy 采样、普通 CUDA Graph、关闭短批量 Flash Attention、完整 CUDA offload、batch 11 与主机控制。

    这是高覆盖工作形状下的峰值,不是服务下限,也不是通用默认值。在单轮 12 题校准中,全词表 K7/S6 的请求全程吞吐为 47.032 token/s,proposal 接受率 52.30%;前缀 FR 为 37.290 token/s,接受率 24.82%。每种模式都有 11 题触及输出上限。

    此前的混合制品边界仍单独保留:完整回滚的 K7/S7 稳态解码为 175.2089 token/s,重复 100 题负载为 83.228 token/s。该 19,187,686,464 字节制品的主 FFN 使用 Q4_0,MTP block 使用 Q6_K,draft head 使用 Q4_K。

    当前验收主机为 Windows 11、RTX 4090 与 10 核 20 线程 Intel Xeon w5-2445。0x55555 亲和性掩码与该机器拓扑绑定,不是可移植的产品默认值。

    智力水平下降了吗?

    当前纯 Q6_K 矩阵的宽松分数保持 67/100,严格格式分数从 60/100 降到 58/100。MTP 有 2 个宽松收益、2 个宽松损失,提取答案一致 89/100,完整输出一致 50/100;双方都未截断的 59 题保持相同提取答案。因此不能宣称智力不变或逐字无损,生产默认门槛仍然关闭。

    DSpark 的跨领域矩阵没有观察到分数下降:宽松 73/100、严格 59/100,对照为 67/100 与 58/100;双方都未截断的 58 题保持相同提取答案。但完整输出一致率只有 54/100,因此不能宣称无损默认等价,更不能把固定任务分数解释为通用智力。

    DFlash2 校准中,两种模式都是 9/12,提取答案 12/12 一致,但完整输出只有 7/12 一致。这组小样本没有观察到分数下降,却也不能证明通用智力等价或逐字无损。

    此前的混合制品 K7/S7 配置在固定重复样本上没有观察到回归:

    • TBQ4 自回归:宽松 70/100,严格 64/100;
    • 全词表 K7/S7:宽松 76/100,严格 66/100;
    • 900 个请求全部完成,零错误;
    • 每个预测在三次重复中完全稳定;
    • proposal 接受率 51.33%,重放与防护触发均为零。

    这些是固定任务准确率代理,不是通用智能或 IQ 分数。配对差异没有达到常见统计显著性,因此不能据此证明 MTP 提升了模型的一般智力。

    已归档的前缀 FR 模式提供了重要反例:稳态峰值很高,但混合负载接受率降至 25.55%,请求全程吞吐降至 27.951 token/s,C-Eval 接受率仅 14.21%。全词表 K7/S7 消除了该 draft 覆盖瓶颈。

    复现边界

    独立复现页给出了可复制命令、固定环境、输入 SHA-256、完整 runner 参数、输出文件与通过条件。

    完整复验分为两层:

    1. 离线验证:无需加载模型,重新计算归档报告的统计值、哈希、门槛与输出身份。
    2. 性能复跑:重建固定的 CUDA 配置,校验精确制品、提示词、ACL 和二进制,再通过 Power 流式 API 执行工作负载。

    当前峰值门槛固定为 1 次预热、9 次实测、每请求生成 1,024 token、batch 11、greedy 采样与确定性输出 SHA-256。模型身份、后端、输出长度、摘要、主机控制或中位数门槛任一不符,runner 都会失败。

    仓库已提交完整步骤与原始证据:

    更换芯片、驱动、显示负载、时钟策略、模型字节或提示词后,应将结果视为一次新实验,不能静默合并进本次验收记录。