For AI agents: the complete documentation index is available at https://a3s-lab.github.io/Power/llms.txt, the full documentation bundle is available at https://a3s-lab.github.io/Power/llms-full.txt, and this page is available as Markdown at https://a3s-lab.github.io/Power/index.md.
  • 简体中文
  • next
  • 模型由你定义。执行交给 Power。

    在 Rust 进程或服务端运行语言、视觉、OCR、嵌入和音频模型。Power 统一处理设备、队列、权重和执行记录,不改写模型逻辑。

    $cargo add a3s-power --no-default-features -F embedded-inference
    3
    CPU、CUDA、Metal 设备
    4
    种后端与嵌入路径
    Q6_K
    当前目标模型验收
    一次前向,验证多个 tokenMTP · K7 / S7

    一套运行时,守住三件事。

    资源有边界

    先检查内存、设备和队列,再执行。超出限制就明确拒绝,不靠隐式回退兜底。

    结果可追溯

    模型、配置、设备、输入和输出写入同一份执行回执,之后可以独立核对。

    验收权在调用方

    客户端按自己的哈希和策略验收,服务端不能悄悄放宽条件。

    速度来自整条执行路径。

    Power 不提供一个含糊的“极速开关”。图、张量、推测解码、调度和权重分别优化;任何快路径都保留精确回退。

    查看全部优化方法

    图与内核

    负责模型 + 后端

    固定常用形状,复用 CUDA Graph;再按实际批量决定是否启用 Flash Attention 和融合算子。

    • 有限形状
    • CUDA Graph
    • Flash Attention
    • 算子融合

    张量路径

    负责Power

    合并小请求,让相邻计算图直接传递设备内结果,只在最终输出时复制一次。

    • 微批处理
    • 张量批次
    • 设备驻留
    • 单次复制

    推测解码

    负责Power + 后端

    草稿负责猜,目标模型负责验。只提交通过的 token;遇到不匹配就回到最后一个正确位置。

    • 目标模型校验
    • K / S 形状
    • MTP / FR
    • 精确回滚

    调度与副本

    负责Power + 主机

    队列、连续批处理和会话副本共用同一设备预算;主机再配置 GPU 优先级和 CPU 亲和性。

    • 设备准入
    • 连续批处理
    • 会话副本
    • 主机调度

    权重与驻留

    负责Power

    按需读取、预取和缓存热点权重;缓存不足时回到原始制品,张量身份始终不变。

    • LFRU
    • 异步预取
    • 驻留计划
    • 局部镜像

    上线前验证

    负责Power + 客户端

    同一输入交替测试新旧配置。速度更快、输出一致、质量过线,才允许替换原路径。

    • 双顺序 A/B
    • 输出一致
    • 质量门槛
    • 硬件记录

    一台 RTX 4090,一组可复现结果。

    Qwen3.8-27B · 原始 Q6_K · 峰值 revision da2c1dd · 质量 revision 64aef15

    复现这组数据
    174.413
    Q6_K 稳态解码中位数 token/s
    41.035
    MTP 质量负载请求全程 token/s
    73.57%
    相对自回归的请求全程提升
    6 / 6
    质量轮次通过 GPU 独占校验
    模式质量证据请求全程 t/s稳态 t/s
    Q6_K / AR · 3×10067 / 6023.642
    Q6_K + MTP / full · 3×100当前67 / 5841.035
    Q6_K + MTP / FR · K7/S6/B11输出哈希一致174.413

    174.413 token/s 是 9 次 1,024-token 稳态解码的中位数,最低 172.723,不是 175 token/s 服务保底值。MTP 在 3×100 题上快 1.736 倍,但严格分数从 60/100 降到 58/100,因此不是无损默认模式。

    按你的方式接入。

    Rust 库

    直接嵌入进程

    不监听端口,不启动子进程。模型代码直接使用设备、队列、状态和执行回执。

    embedded-inference
    推理服务

    接入现有客户端

    提供 OpenAI 兼容 API,支持对话、补全、嵌入和模型管理;需要时可启用 RA-TLS 或 vsock。

    server + backend
    制品安装

    安全落盘模型

    流式下载模型,校验大小与 SHA-256,最后在跨进程锁内一次原子提交。

    artifact-provisioning

    Power 管执行,不替模型做决定。

    模型 crate 决定拓扑、分词、预处理和质量策略;Power 提供设备、调度、完整性、隐私和验证。接入新模型不需要修改运行时核心。

    查看架构边界
    1. 准入内存和队列够不够?
    2. 执行使用哪条设备路径?
    3. 提交这次输出绑定了什么?
    4. 验收调用方是否接受?

    先接入一个模型。

    用嵌入式运行时开始,或直接启动 OpenAI 兼容服务。性能优化和执行验证都可以沿用同一套接口。
    快速开始 查看源码