资源有边界
先检查内存、设备和队列,再执行。超出限制就明确拒绝,不靠隐式回退兜底。
在 Rust 进程或服务端运行语言、视觉、OCR、嵌入和音频模型。Power 统一处理设备、队列、权重和执行记录,不改写模型逻辑。
cargo add a3s-power --no-default-features -F embedded-inferencespec_mode = "mtp"为 7 个候选位置保留目标模型、草稿模型、采样器和解码器状态。
先检查内存、设备和队列,再执行。超出限制就明确拒绝,不靠隐式回退兜底。
模型、配置、设备、输入和输出写入同一份执行回执,之后可以独立核对。
客户端按自己的哈希和策略验收,服务端不能悄悄放宽条件。
Power 不提供一个含糊的“极速开关”。图、张量、推测解码、调度和权重分别优化;任何快路径都保留精确回退。
固定常用形状,复用 CUDA Graph;再按实际批量决定是否启用 Flash Attention 和融合算子。
合并小请求,让相邻计算图直接传递设备内结果,只在最终输出时复制一次。
草稿负责猜,目标模型负责验。只提交通过的 token;遇到不匹配就回到最后一个正确位置。
队列、连续批处理和会话副本共用同一设备预算;主机再配置 GPU 优先级和 CPU 亲和性。
按需读取、预取和缓存热点权重;缓存不足时回到原始制品,张量身份始终不变。
同一输入交替测试新旧配置。速度更快、输出一致、质量过线,才允许替换原路径。
Qwen3.8-27B · 原始 Q6_K · 峰值 revision da2c1dd · 质量 revision 64aef15
| 模式 | 质量证据 | 请求全程 t/s | 稳态 t/s |
|---|---|---|---|
| Q6_K / AR · 3×100 | 67 / 60 | 23.642 | — |
| Q6_K + MTP / full · 3×100当前 | 67 / 58 | 41.035 | — |
| Q6_K + MTP / FR · K7/S6/B11 | 输出哈希一致 | — | 174.413 |
174.413 token/s 是 9 次 1,024-token 稳态解码的中位数,最低 172.723,不是 175 token/s 服务保底值。MTP 在 3×100 题上快 1.736 倍,但严格分数从 60/100 降到 58/100,因此不是无损默认模式。
不监听端口,不启动子进程。模型代码直接使用设备、队列、状态和执行回执。
embedded-inference提供 OpenAI 兼容 API,支持对话、补全、嵌入和模型管理;需要时可启用 RA-TLS 或 vsock。
server + backend流式下载模型,校验大小与 SHA-256,最后在跨进程锁内一次原子提交。
artifact-provisioning