优化手册
Power 没有一个包打天下的“极速模式”。它把可移植的运行时机制、模型自有算法、后端内核、主机控制和制品转换分开,因此同一运行时可以服务语言、视觉、OCR、嵌入、音频、多模态、科学计算和调用方自有图。
先看职责标签
Power 可以约束并记录模型自有决策,但不会从文件名、模型家族、张量名、序列长度、图像几何或后端标签推导模型语义。
完整优化地图
这些机制可以组合,但不会自动全部开启。
按无损优先顺序调优
对 Agent、RAG 与 Coding 负载,先用精确推测执行提高每次目标前向的有效输出,再用带键前缀复用消除重复 prefill;两条路径完成全负载验证后,才考虑量化。推测执行优化 decode,前缀复用优化 prefill 与 TTFT。量化会改变制品,实际收益取决于并发、内核和内存压力。
图形状与内核
模型 crate 声明少量不透明的优化形状身份。Power 只检查聚合 batch、张量、scratch、设备、制品和安全边界;未覆盖的形状要么关闭失败,要么进入有摘要身份的动态路径。
只有后续请求匹配捕获几何时,图捕获才能复用。Draft 宽度、目标验证容量、batch、上下文桶和并行请求数都会产生新形状。提高 proposal 接受率的自适应配置,也可能因为图形状碎片化而降低总吞吐。
因此,Power 的按请求自适应控制器先在回滚窗口内探测,只保留少量热形状。首轮全部接受才开启宽形状;首轮部分接受就关闭该路径;连续低收益则单向切回目标模型。当前 DSpark 采集只复用 K6/K10 形状,三次峰值都超过 160 token/s,且回放为零;但配对质量损失仍使它不能成为默认配置。
Flash Attention 按配置启用。它通常有利于上下文较长的注意力,但短 target/draft batch 可能被启动和布局成本抵消;这项决策属于模型与后端配置。
Power 会在静态图中间张量的最后一个消费者之后释放它。目前已审查的 CUDA 降低覆盖精确的深度卷积、HardSigmoid 门控、误差函数激活、卷积/偏置/激活和 LayerNorm 尾部模式;未审查的形状和 dtype 继续走普通路径。
张量路径
确定性微批处理保持调用顺序,并在启动前检查当时的主机和设备内存。标准前导轴堆叠/拆分接口验证尾部形状、分区、有限值、顺序与张量限制。
相邻已审查图可以通过仿射 ResidentGraphTensor 传递结果,不产生中间主机副本。运行时、逻辑设备、请求许可、dtype 和已审查形状必须一致。Power 只计算初始输入和最终实体化输出的摘要,不伪造中间摘要,也不在运行时之间静默复制。
精确推测执行
Prompt lookup、n-gram context、原生 MTP、DFlash 与 DSpark 适配器共用同一事务:检查点、proposal、目标校验、提交匹配前缀、输出一个 correction 或 bonus token,失败时恢复到最后一次提交。
spec_draft_max限制 proposal 宽度。spec_mtp_recurrent_snapshots限制常驻回滚状态。- 目标 batch 必须容纳 anchor 与 proposal 行。
- FR 只缩小 draft head 的投影行数,对工作负载非常敏感。
- TBQ4、动态量化和混合量化是制品选择,不是通用运行时开关。
- 按请求宽度控制器由原生 MTP、DFlash 与 DSpark 适配器共享;
spec_mtp_adaptive只是兼容键名,不代表 Qwen 专用实现。 - DFlash2 使用独立的 selector/convolution 制品契约。原生 Power 在高接受率提示词上达到 144.453 token/s 解码中位数,对照为 33.075;固定 12 题负载为 45.143 对 29.702 token/s,完整输出只一致 7/12,因此该模式仍需显式启用。
接受率不是最终目标。需要比较每次目标前向提交的 token 数,与 draft、目标校验、同步、采样、回放和图形状成本。
调度与副本
模型队列、物理设备、活动请求和未完成加载共用一条取消安全的准入路径。一个单调时钟 deadline 可以跨越顺序等待,不必暴露请求时间或身份。
连续批处理只在下一执行步接纳新成员,并原子提交每一步。独占会话副本租约同样适用于 KV cache、循环状态、OCR 上下文、嵌入会话和多模态状态,不存在模型家族分支。
托管 API 还接受显式 prompt_cache_key。Power 校验该字段,按认证身份、端点与模型做哈希隔离,只转发给声明支持精确前缀复用的后端。当前 llama.cpp 文本请求使用每模型有界 LRU/TTL 上下文映射;无法证明的循环状态回滚会记为 miss,其他路径失败关闭。原生 MTP 与缓存会话尚不能组合,完整约束见规范缓存文档。
高优先级 CUDA stream、物理核亲和性、进程优先级、电源与时钟策略、单模型/单并发都是主机配置。它们可以降低抖动,但不能物理独占共享的 WDDM 显示 GPU。
权重 I/O 与驻留
所有路径都保留规范张量身份、dtype、shape、字节区间与集合摘要:
- 已验证 mmap、缓冲位置读取、对齐直接读取,以及诚实标注的 macOS cache bypass;
- 不相交分片根、完整或局部只读副本;
- 可寻址认证加密源和有类型的无损 rANS 副本;
- 利用必做完整性校验测速的源权重,不另做隐藏探测;
- LFRU 或 LRU 缓存,手动 pin 与计划 pin 分开记账;
- 有界去重预取、每 key 加载串行化与当前层有序暂存;
- 重复 expert 合并加载与可评估的跨层路由提示;
- 硬件感知驻留预算、整组计划、带迟滞的在线适配和按收益排序的局部镜像。
零缓存、无在线适配仍是安全默认值。模型 crate 决定原子分组、安全切换边界,以及预取提示是否值得采用。
融合加速器批次与设备网格
融合批次只获取当前驻留计划已经 pin 的分组。内核不可用时只能选择声明过摘要身份的精确回退;数值或策略错误仍然失败。
异构网格限制设备数、有向传输大小、启动次数和总流量。Power 提供受控传输和证据;模型 crate 负责分图、激活移动、归约顺序,以及点对点传输是否真的比本地执行更便宜。
证据也是优化的一部分
候选配置至少执行两轮,并同时测量 baseline→candidate 与 candidate→baseline。选择使用两个顺序中较低的中位数,限制 p99 与缓存命中回归,要求输出一致;完全相同则保留 baseline。
稳态解码必须和请求全程吞吐一起发布。速度还要绑定输出身份、质量、截断、proposal 接受率、每次目标前向验证 token 数、回放、内存、设备路径、环境和源码 revision。峰值提示词不是服务 SLO。
后端边界
Power 负责共同的制品、准入、设备、调度、状态与证据层。增加模型意味着增加或选择适配器,不是在调度器中增加模型名称分支。
当前 Q6_K 案例证明了什么
仓库中的 RTX 4090 集成保持 Q6_K 字节完全不变。
- K7/S6/B11 峰值配置:9 个精确构建样本的中位数为 174.413 token/s、最低 172.723、最高 177.150。
- 较安静主机的历史高水位:中位数 176.611 token/s。
- 当前全词表 3×100 质量配置:请求全程吞吐 41.035 token/s,对照为 23.642,提升 73.57%。
- 当前配置的宽松分数保持 67/100,严格分数从 60/100 变为 58/100,因此仍是可选模式,不是无损默认模式。
峰值配置组合了固定图形状、短批量 Flash Attention 关闭、普通 CUDA Graph、精确 MTP 校验、实测目标 batch、高优先级 stream、物理核亲和性和单服务调度。它只是一个后端案例,不是通用默认值,也不是通用智力证明。
