PAM(Physical Action Model,物理执行大模型)是涂鸦智能 AI 算法团队基于真实 IoT 语料进行垂直优化训练的大模型,是涂鸦"物理世界 AI 基座"战略的重要组成部分。
在 AI 硬件加速普及的背景下,"听得懂"已成为大模型的标配能力,但"做得对"才是连接 AI 与物理世界的真正门槛。通用大模型在 AI+IoT 控制场景中面临速度与准确率难以兼顾的矛盾,并普遍存在检索拖累、思考冗余、指令幻觉等执行断层。PAM 围绕全量 Schema 直推、无 CoT 极速生成、跨品牌精准映射三条主线,为 AI 硬件构建了实时执行的技术底座。
通用大模型在 AI+IoT 设备控制场景中的核心矛盾与断层:
| 挑战类型 | 问题描述 |
|---|---|
| 速度 vs 准确率矛盾 | 轻量级模型首响够快但跨品牌指令准确率掉线;大参数模型准确率高但思考链路过长,无法支撑端侧"亚秒级"响应 |
| 检索拖累 | 依赖 RAG 在全屋设备字典中反复检索,链路一长响应就慢 |
| 思考冗余 | 通用大模型的 CoT(链式思考)在控制场景属于"过度思考",每次开灯都要"想一想" |
| 指令幻觉 | 跨品牌、跨协议的设备指令字段不统一,“答得头头是道,灯却不亮” |
PAM 采用面向物理控制域深度优化的 SLM(Small Language Model,小语言模型)架构,摒弃运行时 RAG 检索,通过超长上下文原生推理直接生成结构化设备指令:
┌───────────────────────────────────────────────────────────────┐
│ User Intent │
│ 自然语言控制指令(单意图 / 多意图 / 口语化) │
└──────────────────────────────┬────────────────────────────────┘
▼
┌───────────────────────────────────────────────────────────────┐
│ PAM Inference Engine │
│ │
│ 全量 Schema 一次性载入超长上下文(零 RAG) │
│ ▼ │
│ 无 CoT 直推 ── 约束解码 ── 结构化设备指令生成 │
│ ▼ │
│ 跨品牌 / 跨协议 统一语义映射 │
│ ▼ │
│ 边界自知:诚实拒识(不存在设备 / 越界指令) │
└──────────────────────────────┬────────────────────────────────┘
▼
┌───────────────────────────────────────────────────────────────┐
│ Device Execution │
│ 异构设备精准执行(灯具/空调/扫地机/传感器) │
└───────────────────────────────────────────────────────────────┘
行业主流方案普遍依赖 RAG 检索完成设备字典查询,在全屋设备规模扩大、品牌协议碎片化的现实环境中,检索延迟与错配风险会被放大。
PAM 创新性地采用超长上下文原生推理路线:
依托面向物理控制域深度优化的 SLM 架构,剥离通用大模型冗余的链式思考,直接将自然语言转为结构化设备指令:
| 指标 | PAM 表现 |
|---|---|
| 模型决策时间 P95 | ≤ 220 ms |
| 跨品牌设备指令精准映射准确率 | ≥ 99% |
| 意图拆解 | 原生支持单 / 多意图精准拆解,无需 Prompt 工程加持 |
从早期内部版本的 0.481 s 到正式发布的 P95 ≤ 220 ms,决策耗时一路持续压降,这是 PAM 数据飞轮"让模型与真实世界一起生长"的第一份实证。
跨品牌设备指令字段不一、协议碎片是行业多年顽疾。PAM 基于涂鸦多年沉淀的海量 IoT 真实语料,完成跨品牌、跨协议的统一语义对齐:
AI+IoT 控制场景最大的隐患是"假装做对"——听到陌生指令就编、不会还硬上。PAM 从设计之初将"诚实拒识"作为基础能力,主动识别两类典型边界:
| 边界场景 | 示例 | PAM 行为 |
|---|---|---|
| 多指令中夹带不存在的设备 | “打开客厅灯、空调调 26 度,再启动客厅烤箱”(家中无此烤箱) | 精准执行前两条,明确反馈"未找到客厅烤箱" |
| 设备存在但指令越界 | “把卧室空调调出童年回忆模式”(设备不支持此模式) | 反馈"当前设备不支持此操作",不强行映射 |
| 能力维度 | 指标 |
|---|---|
| 模型决策时间 P95 | ≤ 220 ms |
| 跨品牌指令准确率 | ≥ 99% |
| 智能音箱单指令端到端响应 | < 1.5 s |
| RAG 依赖 | 零(全量 Schema 原生推理) |
| CoT 依赖 | 无(直觉式推理链路) |
通过涂鸦智能全栈开发平台,开发者可快速将 PAM 接入各类智能硬件形态:
| 场景 | 能力应用 |
|---|---|
| 智能音箱 · 极简指令 | "开灯、关空调、调亮度"等最高频指令的极速响应 |
| 智能音箱 · 标准与泛化指令 | 既能理解"把灯调成红色",也能理解"灯太亮了""有点暗"等口语感受 |
| 智能音箱 · 复杂多设备指令 | 组合控制、跨设备协同,考验"听清 + 拆得对 + 执行稳"的综合能力 |
PAM 的技术差异化体现在三个层面:
作为涂鸦"物理世界 AI 基座"的执行底座,PAM 为 AI 与物理世界之间搭建了一条稳定、高效、可信的执行通路,助力开发者以极低成本构建具备"理解 + 执行"能力的 AI 硬件。
该内容对您有帮助吗?
是意见反馈该内容对您有帮助吗?
是意见反馈