涂鸦 PAM:物理执行大模型技术架构与核心能力解析

更新时间:2026-07-24 09:40:37LLM 副本以 Markdown 格式查看下载 PDF

概述

PAM(Physical Action Model,物理执行大模型)是涂鸦智能 AI 算法团队基于真实 IoT 语料进行垂直优化训练的大模型,是涂鸦"物理世界 AI 基座"战略的重要组成部分。

在 AI 硬件加速普及的背景下,"听得懂"已成为大模型的标配能力,但"做得对"才是连接 AI 与物理世界的真正门槛。通用大模型在 AI+IoT 控制场景中面临速度与准确率难以兼顾的矛盾,并普遍存在检索拖累、思考冗余、指令幻觉等执行断层。PAM 围绕全量 Schema 直推、无 CoT 极速生成、跨品牌精准映射三条主线,为 AI 硬件构建了实时执行的技术底座。


行业挑战

通用大模型在 AI+IoT 设备控制场景中的核心矛盾与断层:

挑战类型 问题描述
速度 vs 准确率矛盾 轻量级模型首响够快但跨品牌指令准确率掉线;大参数模型准确率高但思考链路过长,无法支撑端侧"亚秒级"响应
检索拖累 依赖 RAG 在全屋设备字典中反复检索,链路一长响应就慢
思考冗余 通用大模型的 CoT(链式思考)在控制场景属于"过度思考",每次开灯都要"想一想"
指令幻觉 跨品牌、跨协议的设备指令字段不统一,“答得头头是道,灯却不亮”

系统架构

PAM 采用面向物理控制域深度优化的 SLM(Small Language Model,小语言模型)架构,摒弃运行时 RAG 检索,通过超长上下文原生推理直接生成结构化设备指令:

┌───────────────────────────────────────────────────────────────┐
│                       User Intent                              │
│           自然语言控制指令(单意图 / 多意图 / 口语化)             │
└──────────────────────────────┬────────────────────────────────┘
                               ▼
┌───────────────────────────────────────────────────────────────┐
│                  PAM Inference Engine                          │
│                                                               │
│   全量 Schema 一次性载入超长上下文(零 RAG)                      │
│               ▼                                                │
│   无 CoT 直推 ── 约束解码 ── 结构化设备指令生成                  │
│               ▼                                                │
│   跨品牌 / 跨协议 统一语义映射                                   │
│               ▼                                                │
│   边界自知:诚实拒识(不存在设备 / 越界指令)                     │
└──────────────────────────────┬────────────────────────────────┘
                               ▼
┌───────────────────────────────────────────────────────────────┐
│                    Device Execution                            │
│              异构设备精准执行(灯具/空调/扫地机/传感器)            │
└───────────────────────────────────────────────────────────────┘

核心技术突破

1. 架构革新:零 RAG + 全量 Schema

行业主流方案普遍依赖 RAG 检索完成设备字典查询,在全屋设备规模扩大、品牌协议碎片化的现实环境中,检索延迟与错配风险会被放大。

PAM 创新性地采用超长上下文原生推理路线:

  • 全屋物模型一次性载入:将全屋设备物模型一次性载入模型上下文,摒弃运行时 RAG 检索
  • 约束解码压制幻觉:基于真实设备字典在生成阶段进行约束解码,从源头压制指令幻觉
  • “开口即看清全屋”:真正做到出口即贴合设备

2. 体验突破:无 CoT + SLM 架构

依托面向物理控制域深度优化的 SLM 架构,剥离通用大模型冗余的链式思考,直接将自然语言转为结构化设备指令:

指标 PAM 表现
模型决策时间 P95 ≤ 220 ms
跨品牌设备指令精准映射准确率 ≥ 99%
意图拆解 原生支持单 / 多意图精准拆解,无需 Prompt 工程加持

从早期内部版本的 0.481 s 到正式发布的 P95 ≤ 220 ms,决策耗时一路持续压降,这是 PAM 数据飞轮"让模型与真实世界一起生长"的第一份实证。

3. 生态原生:跨品牌精准映射

跨品牌设备指令字段不一、协议碎片是行业多年顽疾。PAM 基于涂鸦多年沉淀的海量 IoT 真实语料,完成跨品牌、跨协议的统一语义对齐:

  • 无论不同品牌的灯具、空调、扫地机器人,还是不同协议下的传感器、执行器,都能在同一套语义空间下被精准识别与调度
  • 一句话调度全屋异构设备无需用户记住"哪个 App 控哪盏灯",生态孤岛从底层被打通

4. 边界自知:诚实拒识的反幻觉执行

AI+IoT 控制场景最大的隐患是"假装做对"——听到陌生指令就编、不会还硬上。PAM 从设计之初将"诚实拒识"作为基础能力,主动识别两类典型边界:

边界场景 示例 PAM 行为
多指令中夹带不存在的设备 “打开客厅灯、空调调 26 度,再启动客厅烤箱”(家中无此烤箱) 精准执行前两条,明确反馈"未找到客厅烤箱"
设备存在但指令越界 “把卧室空调调出童年回忆模式”(设备不支持此模式) 反馈"当前设备不支持此操作",不强行映射

性能指标

能力维度 指标
模型决策时间 P95 ≤ 220 ms
跨品牌指令准确率 ≥ 99%
智能音箱单指令端到端响应 < 1.5 s
RAG 依赖 零(全量 Schema 原生推理)
CoT 依赖 无(直觉式推理链路)

适用场景

通过涂鸦智能全栈开发平台,开发者可快速将 PAM 接入各类智能硬件形态:

场景 能力应用
智能音箱 · 极简指令 "开灯、关空调、调亮度"等最高频指令的极速响应
智能音箱 · 标准与泛化指令 既能理解"把灯调成红色",也能理解"灯太亮了""有点暗"等口语感受
智能音箱 · 复杂多设备指令 组合控制、跨设备协同,考验"听清 + 拆得对 + 执行稳"的综合能力

接入方式

  • 无需从零构建:无需组建大模型团队、采购海量 IoT 控制语料、自训设备控制模型
  • 即插即用:依托涂鸦完善的 AI+IoT 全栈生态,硬件、云端与模型能力实现快速接入与高效调优
  • 缩短研发周期:极大降低具备"理解 + 执行"一体化能力的 AI 硬件门槛

总结

PAM 的技术差异化体现在三个层面:

  1. 架构层:零 RAG + 全量 Schema 原生推理 + SLM 无 CoT 直推,从源头解决检索延迟与思考冗余
  2. 算法层:跨品牌统一语义映射 + 约束解码反幻觉,实现 ≥99% 指令准确率与诚实拒识
  3. 工程层:P95 ≤ 220 ms 的毫秒级决策,专为设备端"话音落、动作起"的极速响应定制

作为涂鸦"物理世界 AI 基座"的执行底座,PAM 为 AI 与物理世界之间搭建了一条稳定、高效、可信的执行通路,助力开发者以极低成本构建具备"理解 + 执行"能力的 AI 硬件。