For AI agents: the complete documentation index is available at https://a3s-lab.github.io/Power/llms.txt, the full documentation bundle is available at https://a3s-lab.github.io/Power/llms-full.txt, and this page is available as Markdown at https://a3s-lab.github.io/Power/optimization.md.
  • 简体中文
  • next
  • 优化手册

    Power 没有一个包打天下的“极速模式”。它把可移植的运行时机制、模型自有算法、后端内核、主机控制和制品转换分开,因此同一运行时可以服务语言、视觉、OCR、嵌入、音频、多模态、科学计算和调用方自有图。

    先看职责标签

    标签决策归属
    运行时Power 实现模型中立的边界或执行机制。
    模型 crate集成方拥有拓扑、形状含义、状态布局、数值计算与质量策略。
    后端mistral.rs、llama.cpp、picolm、Candle、CUDA 或 Metal 拥有内核路径。
    主机配置与机器相关;换一台主机就必须重新测量。
    制品配置会改变或扩展模型字节的转换与量化。
    客户端门槛在产生结果的服务之外执行的验收策略。

    Power 可以约束并记录模型自有决策,但不会从文件名、模型家族、张量名、序列长度、图像几何或后端标签推导模型语义。

    完整优化地图

    执行层可用机制职责
    形状与启动有限形状配置、稳定图形状、最后消费者释放、已审查 CUDA 融合运行时 + 模型 crate + 后端
    注意力与解码Flash Attention、完整设备 offload、GPU 批量采样、CUDA Graph 复用后端 + 模型 crate
    张量路径确定性微批处理、前导轴堆叠/拆分、设备驻留已审查图链运行时
    推测执行Prompt lookup、n-gram、原生 MTP、精确目标校验、快照、回滚防护、FR 投影运行时 + 适配器 + 制品配置
    前缀复用显式缓存 key、认证命名空间、有界 KV 生命周期、命中/token 指标运行时 + 后端
    调度模型/设备准入、连续批处理、会话副本、取消、单调时钟 deadline运行时
    主机调度CUDA stream 优先级、物理核亲和性、进程优先级、时钟策略、单服务 GPU后端 + 主机配置
    权重 I/O已验证 mmap、位置/直接读取、分片、副本、加密/无损源、局部镜像运行时
    驻留LFRU/LRU、预取、有序暂存、热集计划、硬件预算、在线适配运行时 + 模型 crate
    加速器拓扑绑定驻留计划的融合批次、精确回退、有界多设备网格运行时 + 模型 crate + 后端
    证明双顺序 A/B、输出等价、质量门槛、回执、硬件证据、离线哈希验真运行时 + 客户端门槛

    这些机制可以组合,但不会自动全部开启。

    按无损优先顺序调优

    对 Agent、RAG 与 Coding 负载,先用精确推测执行提高每次目标前向的有效输出,再用带键前缀复用消除重复 prefill;两条路径完成全负载验证后,才考虑量化。推测执行优化 decode,前缀复用优化 prefill 与 TTFT。量化会改变制品,实际收益取决于并发、内核和内存压力。

    图形状与内核

    模型 crate 声明少量不透明的优化形状身份。Power 只检查聚合 batch、张量、scratch、设备、制品和安全边界;未覆盖的形状要么关闭失败,要么进入有摘要身份的动态路径。

    只有后续请求匹配捕获几何时,图捕获才能复用。Draft 宽度、目标验证容量、batch、上下文桶和并行请求数都会产生新形状。提高 proposal 接受率的自适应配置,也可能因为图形状碎片化而降低总吞吐。

    因此,Power 的按请求自适应控制器先在回滚窗口内探测,只保留少量热形状。首轮全部接受才开启宽形状;首轮部分接受就关闭该路径;连续低收益则单向切回目标模型。当前 DSpark 采集只复用 K6/K10 形状,三次峰值都超过 160 token/s,且回放为零;但配对质量损失仍使它不能成为默认配置。

    Flash Attention 按配置启用。它通常有利于上下文较长的注意力,但短 target/draft batch 可能被启动和布局成本抵消;这项决策属于模型与后端配置。

    Power 会在静态图中间张量的最后一个消费者之后释放它。目前已审查的 CUDA 降低覆盖精确的深度卷积、HardSigmoid 门控、误差函数激活、卷积/偏置/激活和 LayerNorm 尾部模式;未审查的形状和 dtype 继续走普通路径。

    张量路径

    确定性微批处理保持调用顺序,并在启动前检查当时的主机和设备内存。标准前导轴堆叠/拆分接口验证尾部形状、分区、有限值、顺序与张量限制。

    相邻已审查图可以通过仿射 ResidentGraphTensor 传递结果,不产生中间主机副本。运行时、逻辑设备、请求许可、dtype 和已审查形状必须一致。Power 只计算初始输入和最终实体化输出的摘要,不伪造中间摘要,也不在运行时之间静默复制。

    精确推测执行

    Prompt lookup、n-gram context、原生 MTP、DFlash 与 DSpark 适配器共用同一事务:检查点、proposal、目标校验、提交匹配前缀、输出一个 correction 或 bonus token,失败时恢复到最后一次提交。

    • spec_draft_max 限制 proposal 宽度。
    • spec_mtp_recurrent_snapshots 限制常驻回滚状态。
    • 目标 batch 必须容纳 anchor 与 proposal 行。
    • FR 只缩小 draft head 的投影行数,对工作负载非常敏感。
    • TBQ4、动态量化和混合量化是制品选择,不是通用运行时开关。
    • 按请求宽度控制器由原生 MTP、DFlash 与 DSpark 适配器共享;spec_mtp_adaptive 只是兼容键名,不代表 Qwen 专用实现。
    • DFlash2 使用独立的 selector/convolution 制品契约。原生 Power 在高接受率提示词上达到 144.453 token/s 解码中位数,对照为 33.075;固定 12 题负载为 45.143 对 29.702 token/s,完整输出只一致 7/12,因此该模式仍需显式启用。

    接受率不是最终目标。需要比较每次目标前向提交的 token 数,与 draft、目标校验、同步、采样、回放和图形状成本。

    调度与副本

    模型队列、物理设备、活动请求和未完成加载共用一条取消安全的准入路径。一个单调时钟 deadline 可以跨越顺序等待,不必暴露请求时间或身份。

    连续批处理只在下一执行步接纳新成员,并原子提交每一步。独占会话副本租约同样适用于 KV cache、循环状态、OCR 上下文、嵌入会话和多模态状态,不存在模型家族分支。

    托管 API 还接受显式 prompt_cache_key。Power 校验该字段,按认证身份、端点与模型做哈希隔离,只转发给声明支持精确前缀复用的后端。当前 llama.cpp 文本请求使用每模型有界 LRU/TTL 上下文映射;无法证明的循环状态回滚会记为 miss,其他路径失败关闭。原生 MTP 与缓存会话尚不能组合,完整约束见规范缓存文档

    高优先级 CUDA stream、物理核亲和性、进程优先级、电源与时钟策略、单模型/单并发都是主机配置。它们可以降低抖动,但不能物理独占共享的 WDDM 显示 GPU。

    权重 I/O 与驻留

    所有路径都保留规范张量身份、dtype、shape、字节区间与集合摘要:

    • 已验证 mmap、缓冲位置读取、对齐直接读取,以及诚实标注的 macOS cache bypass;
    • 不相交分片根、完整或局部只读副本;
    • 可寻址认证加密源和有类型的无损 rANS 副本;
    • 利用必做完整性校验测速的源权重,不另做隐藏探测;
    • LFRU 或 LRU 缓存,手动 pin 与计划 pin 分开记账;
    • 有界去重预取、每 key 加载串行化与当前层有序暂存;
    • 重复 expert 合并加载与可评估的跨层路由提示;
    • 硬件感知驻留预算、整组计划、带迟滞的在线适配和按收益排序的局部镜像。

    零缓存、无在线适配仍是安全默认值。模型 crate 决定原子分组、安全切换边界,以及预取提示是否值得采用。

    融合加速器批次与设备网格

    融合批次只获取当前驻留计划已经 pin 的分组。内核不可用时只能选择声明过摘要身份的精确回退;数值或策略错误仍然失败。

    异构网格限制设备数、有向传输大小、启动次数和总流量。Power 提供受控传输和证据;模型 crate 负责分图、激活移动、归约顺序,以及点对点传输是否真的比本地执行更便宜。

    证据也是优化的一部分

    候选配置至少执行两轮,并同时测量 baseline→candidate 与 candidate→baseline。选择使用两个顺序中较低的中位数,限制 p99 与缓存命中回归,要求输出一致;完全相同则保留 baseline。

    稳态解码必须和请求全程吞吐一起发布。速度还要绑定输出身份、质量、截断、proposal 接受率、每次目标前向验证 token 数、回放、内存、设备路径、环境和源码 revision。峰值提示词不是服务 SLO。

    后端边界

    路径适用范围谁拥有模型执行
    mistralrsGGUF/SafeTensors 语言、视觉与嵌入服务mistral.rs
    llamacpp / llamacpp-cuda成熟 GGUF 执行与原生 MTPllama.cpp
    picolm受限内存或 TEE 中的纯 Rust 层流式 GGUFpicolm
    embedded-inference视觉、OCR、嵌入、音频、科学计算与自有已审查图模型 crate

    Power 负责共同的制品、准入、设备、调度、状态与证据层。增加模型意味着增加或选择适配器,不是在调度器中增加模型名称分支。

    当前 Q6_K 案例证明了什么

    仓库中的 RTX 4090 集成保持 Q6_K 字节完全不变。

    • K7/S6/B11 峰值配置:9 个精确构建样本的中位数为 174.413 token/s、最低 172.723、最高 177.150。
    • 较安静主机的历史高水位:中位数 176.611 token/s。
    • 当前全词表 3×100 质量配置:请求全程吞吐 41.035 token/s,对照为 23.642,提升 73.57%。
    • 当前配置的宽松分数保持 67/100,严格分数从 60/100 变为 58/100,因此仍是可选模式,不是无损默认模式。

    峰值配置组合了固定图形状、短批量 Flash Attention 关闭、普通 CUDA Graph、精确 MTP 校验、实测目标 batch、高优先级 stream、物理核亲和性和单服务调度。它只是一个后端案例,不是通用默认值,也不是通用智力证明。

    性能证据查看测量结果,从复现实验复制完整命令;规范优化手册给出 API 边界和源码入口。