For AI agents: the complete documentation index is available at https://a3s-lab.github.io/Power/v0.9.0/llms.txt, the full documentation bundle is available at https://a3s-lab.github.io/Power/v0.9.0/llms-full.txt, and this page is available as Markdown at https://a3s-lab.github.io/Power/v0.9.0/performance.md.
  • 简体中文
  • v0.9.0
  • 性能证据

    Power 只接受仍然保留执行契约的性能优化。因此,公开的 Qwen3.8 记录通过真实流式 API 测量,固定制品与二进制身份,校验确定性输出,并同时报告质量、工作负载吞吐与稳态解码速度。

    想直接验证数字,可进入复现实验:先运行无需模型的单命令验真,再按同一输入身份完成 RTX 4090 全流程复跑。

    各模式质量与速度

    Qwen3.8-27B 制品与模式固定任务质量代理请求全程吞吐稳态解码中位数
    原始 Q6_K,自回归宽松 67/100;严格 60/100(100 题,重复 3 次)30.883 token/s35.5793 token/s(较早记录)
    原始 Q6_K,全词表 MTP,K7/S7固定峰值提示词下与 greedy 输出完全一致-147.0207 token/s
    原始 Q6_K,全词表 MTP,K7/S6宽松 5/12;严格 3/12(1 轮;11 题截断)47.032 token/s-
    原始 Q6_K + 前缀 FR8192 MTP,K7/S6宽松 4/12;严格 3/12(1 轮;11 题截断)37.290 token/s176.6109 token/s
    TBQ4 混合制品,自回归宽松 70/100;严格 64/100(100 题,重复 3 次)38.724 token/s-
    TBQ4 混合制品 + 全词表固定 MTP,K7/S7宽松 76/100;严格 66/100(100 题,重复 3 次)83.228 token/s175.2089 token/s
    TBQ4 混合制品 + 全词表防护 MTP,K7/S6宽松 5/12;严格 3/12(12 题,重复 3 次)54.060 token/s177.7165 token/s
    TBQ4 混合制品 + MTP + 前缀 FR(历史模式)宽松 72/100;严格 60/100(100 题,重复 3 次)27.951 token/s184.3665 token/s
    UD-Q8_K_XL,异构 MTP K4/S4跨模式输出哈希不同;未运行完整矩阵-9.7577 token/s

    “请求全程”包含提示词处理、生成、HTTP 和请求开销;“稳态解码”是预热后的重复 1,024-token 工作形状。短横线表示没有可辩护的同口径记录。

    原始 Q6_K 的 176.61 边界

    原始 22,884,408,288 字节 Q6_K 制品使用前缀 FR8192 K7/S6 后,9 个 1,024-token 样本的稳态中位数达到 176.6109 token/s,最低 173.2630,其中 7 个样本不低于 175。同一制品的全词表 K7/S7 对照为 147.0207 token/s,稳态中位数提升 20.13%,所有输出摘要一致。

    模型权重没有重新量化。速度来自原生 MTP、目标模型精确校验、8,192 行 draft-only token-ID 前缀、6 份驻留循环状态快照、GPU 批量 greedy 采样、Flash Attention、完整 CUDA offload、batch 14 与主机控制。

    这是高覆盖工作形状下的峰值,不是服务下限,也不是通用默认值。在单轮 12 题校准中,全词表 K7/S6 的请求全程吞吐为 47.032 token/s,proposal 接受率 52.30%;前缀 FR 为 37.290 token/s,接受率 24.82%。每种模式都有 11 题触及输出上限。

    此前的混合制品边界仍单独保留:完整回滚的 K7/S7 稳态解码为 175.2089 token/s,重复 100 题负载为 83.228 token/s。该 19,187,686,464 字节制品的主 FFN 使用 Q4_0,MTP block 使用 Q6_K,draft head 使用 Q4_K。

    当前验收主机为 Windows 11、RTX 4090 与 10 核 20 线程 Intel Xeon w5-2445。0x55555 亲和性掩码与该机器拓扑绑定,不是可移植的产品默认值。

    智力水平下降了吗?

    原始 Q6_K 前缀 FR 配置尚未完成重复 100 题矩阵。12 题、128-token 校准的截断比例太高,不能据此判断通用智力。目标模型精确校验能证明固定提示词下 greedy 输出一致,但不能取代代表性质量测试。

    此前的混合制品 K7/S7 配置在固定重复样本上没有观察到回归:

    • TBQ4 自回归:宽松 70/100,严格 64/100;
    • 全词表 K7/S7:宽松 76/100,严格 66/100;
    • 900 个请求全部完成,零错误;
    • 每个预测在三次重复中完全稳定;
    • proposal 接受率 51.33%,重放与防护触发均为零。

    这些是固定任务准确率代理,不是通用智能或 IQ 分数。配对差异没有达到常见统计显著性,因此不能据此证明 MTP 提升了模型的一般智力。

    已归档的前缀 FR 模式提供了重要反例:稳态峰值很高,但混合负载接受率降至 25.55%,请求全程吞吐降至 27.951 token/s,C-Eval 接受率仅 14.21%。全词表 K7/S7 消除了该 draft 覆盖瓶颈。

    复现边界

    独立复现页给出了可复制命令、固定环境、输入 SHA-256、完整 runner 参数、输出文件与通过条件。

    完整复验分为两层:

    1. 离线验证:无需加载模型,重新计算归档报告的统计值、哈希、门槛与输出身份。
    2. 性能复跑:重建固定的 CUDA 配置,校验精确制品、提示词、ACL 和二进制,再通过 Power 流式 API 执行工作负载。

    当前门槛固定为 1 次预热、9 次实测、每请求生成 1,024 token、batch 14、greedy 采样与确定性输出 SHA-256。模型身份、后端、输出长度、摘要、主机控制或中位数门槛任一不符,runner 都会失败。

    仓库已提交完整步骤与原始证据:

    更换芯片、驱动、显示负载、时钟策略、模型字节或提示词后,应将结果视为一次新实验,不能静默合并进本次验收记录。