性能证据
Power 只接受仍然保留执行契约的性能优化。因此,公开的 Qwen3.8 记录通过真实流式 API 测量,固定制品与二进制身份,校验确定性输出,并同时报告质量、工作负载吞吐与稳态解码速度。
想直接验证数字,可进入复现实验:先运行无需模型的单命令验真,再按同一输入身份完成 RTX 4090 全流程复跑。
各模式质量与速度
“请求全程”包含提示词处理、生成、HTTP 和请求开销;“稳态解码”是预热后的重复 1,024-token 工作形状。短横线表示没有可辩护的同口径记录。
原始 Q6_K 的 176.61 边界
原始 22,884,408,288 字节 Q6_K 制品使用前缀 FR8192 K7/S6 后,9 个 1,024-token 样本的稳态中位数达到 176.6109 token/s,最低 173.2630,其中 7 个样本不低于 175。同一制品的全词表 K7/S7 对照为 147.0207 token/s,稳态中位数提升 20.13%,所有输出摘要一致。
模型权重没有重新量化。速度来自原生 MTP、目标模型精确校验、8,192 行 draft-only token-ID 前缀、6 份驻留循环状态快照、GPU 批量 greedy 采样、Flash Attention、完整 CUDA offload、batch 14 与主机控制。
这是高覆盖工作形状下的峰值,不是服务下限,也不是通用默认值。在单轮 12 题校准中,全词表 K7/S6 的请求全程吞吐为 47.032 token/s,proposal 接受率 52.30%;前缀 FR 为 37.290 token/s,接受率 24.82%。每种模式都有 11 题触及输出上限。
此前的混合制品边界仍单独保留:完整回滚的 K7/S7 稳态解码为 175.2089 token/s,重复 100 题负载为 83.228 token/s。该 19,187,686,464 字节制品的主 FFN 使用 Q4_0,MTP block 使用 Q6_K,draft head 使用 Q4_K。
当前验收主机为 Windows 11、RTX 4090 与 10 核 20 线程 Intel Xeon w5-2445。0x55555 亲和性掩码与该机器拓扑绑定,不是可移植的产品默认值。
智力水平下降了吗?
原始 Q6_K 前缀 FR 配置尚未完成重复 100 题矩阵。12 题、128-token 校准的截断比例太高,不能据此判断通用智力。目标模型精确校验能证明固定提示词下 greedy 输出一致,但不能取代代表性质量测试。
此前的混合制品 K7/S7 配置在固定重复样本上没有观察到回归:
- TBQ4 自回归:宽松 70/100,严格 64/100;
- 全词表 K7/S7:宽松 76/100,严格 66/100;
- 900 个请求全部完成,零错误;
- 每个预测在三次重复中完全稳定;
- proposal 接受率 51.33%,重放与防护触发均为零。
这些是固定任务准确率代理,不是通用智能或 IQ 分数。配对差异没有达到常见统计显著性,因此不能据此证明 MTP 提升了模型的一般智力。
已归档的前缀 FR 模式提供了重要反例:稳态峰值很高,但混合负载接受率降至 25.55%,请求全程吞吐降至 27.951 token/s,C-Eval 接受率仅 14.21%。全词表 K7/S7 消除了该 draft 覆盖瓶颈。
复现边界
独立复现页给出了可复制命令、固定环境、输入 SHA-256、完整 runner 参数、输出文件与通过条件。
完整复验分为两层:
- 离线验证:无需加载模型,重新计算归档报告的统计值、哈希、门槛与输出身份。
- 性能复跑:重建固定的 CUDA 配置,校验精确制品、提示词、ACL 和二进制,再通过 Power 流式 API 执行工作负载。
当前门槛固定为 1 次预热、9 次实测、每请求生成 1,024 token、batch 14、greedy 采样与确定性输出 SHA-256。模型身份、后端、输出长度、摘要、主机控制或中位数门槛任一不符,runner 都会失败。
仓库已提交完整步骤与原始证据:
更换芯片、驱动、显示负载、时钟策略、模型字节或提示词后,应将结果视为一次新实验,不能静默合并进本次验收记录。
