For AI agents: the complete documentation index is available at https://a3s-lab.github.io/Power/llms.txt, the full documentation bundle is available at https://a3s-lab.github.io/Power/llms-full.txt, and this page is available as Markdown at https://a3s-lab.github.io/Power/architecture.md.
  • 简体中文
  • next
  • 嵌入式推理架构

    Power 把推理视为一个身份与结果都可验证的有界操作,而不是把模型名称当作执行契约。

    从第一性原理推导边界

    客观约束必要契约运行时机制
    内存、算力、队列与传输容量有限每个请求必须具备明确限制与取消语义;相邻图调用不应产生可避免的主机往返有界准入、确定性微批处理、聚合驻留张量预算、放置计划与会话池
    文件名或模型别名无法标识真正执行的字节制品身份必须贯穿存储、镜像与设备放置SHA-256 描述符、签名身份、已验证镜像与驻留证据
    单独的响应无法说明其生成路径运行策略、设备路径、输入与输出必须共同提交规范化执行回执与加速器证据
    服务端不能自行批准自己的声明接受策略必须位于执行边界之外绑定 nonce 的 TEE 证据与独立验证器

    一个核心,三种入口

    锁定修订版的制品包       模型自有计算图          API 客户端
              |                    |                    |
           安装器               嵌入式库              服务
              \                    |                   /
               +------------ 共享运行时核心 ----------+
                                    |
                     准入 / 放置 / 取消
                                    |
                        设备 / 权重 / 状态
                                    |
                        证据 / 规范化回执
                                    |
                             独立验证

    嵌入式库与托管服务只是同一组契约的不同入口,而不是两套模型实现。制品安装保持独立,因为下载与安装经审查的 bundle,和执行它,本来就是不同权限。

    明确划分职责

    Power 负责模型 crate 负责
    类型化 CPU、CUDA、Metal 设备、有界图执行与不透明驻留张量边界架构、拓扑、层、算子与数值计算
    准入、会话池、微批处理、取消与限制分词、前后处理与生成策略
    制品身份、副本、镜像、放置与驻留修订版 pin、转换、张量契约与质量门槛
    TEE 隐私、证明绑定、密封状态与回执KV/循环状态布局与语义状态

    这条边界保持 Power 的模型中立性。语言、视觉、OCR、嵌入以及未来的模型 crate,都能共享资源与证据机制,而无需把自身语义塞进中央模型分支。

    运行时契约

    有界执行

    准入机制限制正在执行和排队的工作。设备准入阻止多个独立模型过量占用同一加速器。请求等待或执行时均可安全检查取消。调用方可以让同一个单调时钟 deadline 覆盖顺序发生的模型队列与物理设备队列;过期会归还之前取得的许可,只记录聚合计数,不保存墙钟时间、请求内容或槽位身份。

    模型自有的有限配置

    模型 crate 可以用不透明的 SHA-256 身份声明有限的优化形状类别。Power 只检查聚合批量、张量元素、暂存内存、设备、制品与 TEE 策略边界;它不解释上下文长度、图像几何、分词方式或模型家族。未覆盖的类别要么关闭失败,要么选择身份明确的动态实现。回执 v5 记录这个决定,但不暴露模型私有几何信息。

    模型中立的可变副本

    有状态的模型 crate 可以为同一组精确模型与执行身份申请有限个延迟初始化、相互独立的会话副本。每个不可克隆的租约独占一个匿名槽位;所有槽位复用同一个已解析运行时与物理设备准入门。Power 在任何 loader 运行前预留最坏情况下的驻留内存,遥测只报告聚合副本数量。语言、视觉、OCR、向量与多模态上下文都走同一条路径:模型家族只是不透明身份,绝不是分派分支。副本准入也可使用同一套单调 deadline 契约;即使空条目随后被删除,池生命周期内的聚合过期计数仍会保留。模型 crate 还可以在自己的健康检查判定可变状态不可复用后,以 retire() 消费独占租约;Power 会在归还槽位前替换匿名状态代,并在下次获取时延迟重建。失败或取消的重建仍可重试,也不会影响健康副本;遥测只包含待重建数量和累计生命周期计数。

    设备驻留的已审查图链

    相邻的已审查图可以通过不透明的 ResidentGraphTensor 传递结果,不必在中间生成主机侧副本。这个不可克隆句柄保留同一份请求许可和共享运行时字节预算。下一张图必须使用相同运行时、逻辑设备与请求许可,并满足 F32 类型和已审查的固定/符号形状契约。错误、取消或丢弃句柄都会归还预算。

    Power 只计算初始自有输入与最终实体化输出的摘要,不伪造中间摘要,也不会在不同运行时之间静默复制。这是通用图边界,不是语言模型专用引擎:架构、量化、注意力、分词、解码、图像几何以及图组合方式仍由模型 crate 负责。

    已验证权重

    权重描述符把张量区间绑定到存储身份。完整与局部镜像在存储层之间保持这一身份。放置与驻留证据记录真实选择的路径,而不只记录首选路径。

    加速器证据

    执行回执可包含声明绑定的设备、回退路径、融合批处理或多设备网格。只有证据与模型、运行设备、输入摘要和输出摘要一致时,才能附加到回执。

    可恢复状态

    认证的密封状态封装把模型与运行时身份绑定到热状态。恢复策略区分主备来源、授权导出范围、检测回滚,并清零敏感材料。

    隐私可观测性

    仅包含摘要的回执与遥测,让系统在不暴露提示词和响应正文的前提下可审计。无法可靠推导的字段保持缺失,绝不伪造确定性证据。

    执行生命周期

    声明限制与身份
           |
           v
    准入模型与设备容量
           |
           v
    解析存储与放置
           |
           v
    执行已审查的模型计划
           |
           v
    提交输入/输出/设备证据
           |
           v
    释放许可并验证回执

    详细设计还覆盖张量批处理、驻留预算、局部镜像、预取提示、异构网格、密封状态与调优证据。优化手册按执行层列出所有通用、模型自有、后端和主机配置。完整 API、不变量与验证门槛参阅规范架构文档;模型中立的职责边界与复现命令见形状配置契约会话副本契约驻留图链契约