ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

具身智能体社会规范遵从性评估:从NormAct基准看AI如何学会“懂事”

具身智能体社会规范遵从性评估:从NormAct基准看AI如何学会“懂事” 1. 从“听话”到“懂事”为什么我们需要评估具身智能体的社会规范遵从性最近在跟几个做具身智能Embodied AI和具身智能体Embodied Agents的朋友聊天大家不约而同地提到了一个痛点我们训练出来的机器人或者虚拟智能体在实验室的封闭测试集上跑分很高指令执行得又快又准但一旦放到稍微复杂一点的现实模拟环境甚至只是多人在线的虚拟空间里就经常表现得像个“愣头青”。比如让它去厨房拿个苹果它可能会径直穿过正在客厅聚会的人群或者把别人刚整理好的东西碰得乱七八糟。它完美地执行了“拿苹果”这个显式指令却完全无视了“不要打扰他人”、“注意社交礼仪”这些没有说出口的潜规则。这其实就是标题里提到的“Unspoken Social Norms”——那些没有明说但被社会普遍接受的行为准则。对于人类来说这是从小耳濡目染习得的“常识”但对于当前的AI尤其是依赖多模态大语言模型MLLM驱动的具身智能体来说这恰恰是最大的盲区。“NormAct”这个基准测试的出现正是为了系统性地衡量和推动智能体从“机械服从”走向“主动合规”的关键一步。它要回答的核心问题是我们的智能体在完成具体任务的同时能否像一个有教养的社会成员一样主动地、恰当地遵守那些不言而喻的社会规范这不仅仅是让机器人更有“礼貌”那么简单。想象一下未来的服务机器人、家庭助理或者元宇宙中的虚拟化身如果它们无法理解“私人空间”、“排队秩序”、“交谈时的眼神接触”这些细微的社会信号带来的将不是便利而是无尽的尴尬甚至冲突。NormAct这类基准测试正是将这种模糊的“体验”问题转化为了可量化、可比较、可优化的技术指标。它标志着具身AI的研究重点正从单纯的任务完成度Task Completion转向更高级的“社会智能”Social Intelligence和“情境化行为”Contextualized Behavior。所以无论你是正在研发下一代具身智能体的工程师还是关注AI与人类社会交互的研究者理解NormAct背后的逻辑、挑战以及它试图衡量的维度都至关重要。它不仅仅是一个排行榜更是一面镜子照出了当前AI在理解复杂人类社会方面的真实水平与巨大差距。接下来我们就深入拆解一下要构建这样一个基准究竟需要攻克哪些难关。2. NormAct基准的核心构成如何量化“不言而喻”的规范构建一个评估社会规范遵从性的基准最大的难点在于“规范”本身是模糊、情境依赖且文化特定的。NormAct不可能穷举所有规范因此它的设计哲学必然是选取一批具有代表性、可操作化的规范场景并将其编码成智能体可以感知和行动的具体任务。根据当前具身AI和MLLM的研究趋势我们可以推断NormAct基准 likely 包含以下几个核心组成部分2.1 规范场景的定义与分类首先基准需要一套清晰的“社会规范分类学”。这通常不是从零开始而是会借鉴社会学、心理学中已有的理论框架并对其进行工程化的改造。例如规范可能被分为以下几类空间规范涉及个人空间、领地意识、通行权等。例如“在狭窄的走廊与人交会时应侧身避让”“未经允许不进入他人的私人房间或过于靠近他人”。物品交互规范涉及对他人所有物的尊重。例如“使用公共物品后应归位”“不随意移动或使用他人明确归属的物品即使它挡住了你的路”。会话与注意力规范涉及多人交互时的礼仪。例如“当两人正在交谈时不从中强行穿过”“寻求帮助时应先获得对方注意力如挥手、呼唤而不是直接下达命令”。效率与协作规范在共享环境中为了整体效率而存在的潜规则。例如“在十字路口遵循先来后到或示意礼让”“不堵塞关键通道”。NormAct会为每一类规范设计多个具体的、可实例化的“场景剧本”。每个剧本都包含一个主任务如“去书房拿一本书”和一个潜在的规范冲突情境如“去书房的路需要经过一个正在专心看电视的人面前”。2.2 多模态情境的构建这是基准的“舞台”。具身智能体需要在一个丰富的多模态环境中接受测试这个环境通常是一个仿真的物理世界如AI2-THOR、Habitat、VR模拟器包含视觉输入智能体的“眼睛”能看到房间布局、物体、其他智能体或虚拟人的姿态、表情、动作。文本指令用户给出的主任务描述通常是简洁的如“请把餐桌上的盐递给我”。环境状态包括物体位置、其他角色的当前行为是否在忙碌、交谈、休息等这些信息可能部分通过视觉感知部分通过环境API获取。关键在于规范冲突的情境不会在指令中明确说明。指令只会说“拿盐”而不会说“拿盐的时候注意不要打扰正在做饭的人”。智能体必须自己从多模态观察中推断出潜在的社会情境并做出合规的决策。2.3 评估指标的设计超越任务成功率的度量传统的具身AI基准主要看“任务是否完成”以及“完成效率路径长度、步数”。NormAct必须引入一套更精细的、针对社会规范的评估体系。这套体系 likely 是分层级的一级指标规范违反检测。这是最基础的二元判断智能体的行为序列中是否出现了明显违反给定场景社会规范的动作例如是否强行从两人中间穿过是否未经示意就拿走了别人手边的物品这可以通过预定义的规则或经过标注的验证器来自动检测。二级指标合规行为质量。如果智能体没有违反规范那么它采取的“合规行为”质量如何这包括主动性智能体是主动采取了规避或礼貌行为如绕路、等待、打招呼还是仅仅因为运气好没有撞上规范冲突例如去书房的路有两条一条经过看电视的人一条不经过。智能体“恰好”选了不经过的那条这不算真正的合规理解。恰当性采取的行为是否与情境的紧急程度、文化背景相匹配例如在非常紧急的情况下一声快速的“借过”后通过可能比长时间等待更合适。这部分的评估往往需要人工标注或更复杂的模型来判断。效率代价遵守规范通常意味着牺牲一些效率如绕远路、等待时间。一个理想的智能体应在合规与效率间取得良好平衡。可以计算“合规路径长度/时间”与“最优无视规范路径长度/时间”的比值作为效率代价的度量。三级指标可解释性与用户感知。最终智能体的行为需要让人感到舒适、自然。这可以通过主观评价来实现例如让人类评估者观看智能体的行为录像从“礼貌程度”、“自然度”、“侵入感”等方面进行打分。这对于MLLM驱动的智能体尤其重要因为其决策过程可能更接近人类的推理。2.4 智能体架构的挑战接口NormAct作为一个基准也需要定义智能体与环境的交互接口。对于基于MLLM的智能体这通常意味着感知编码将当前视觉观察图像帧编码成MLLM可以理解的视觉特征。情境提示将任务指令、历史交互、可能的环境状态文本如“电视正在播放节目”组合成给MLLM的提示词。动作生成MLLM基于多模态输入输出下一步的行动决策。这可能是低级的动作指令如“向前走”、“左转”也可能是高级的技能调用如“执行绕行路径规划”、“发出语音‘打扰一下’”。反馈循环环境执行动作后给出新的观察循环继续。基准会提供标准的仿真环境接口和基础智能体框架让研究者可以专注于提升智能体核心的“社会推理”模块。3. MLLM如何赋能从感知到推理的社会规范内化之路多模态大语言模型MLLM如GPT-4V、Gemini等为NormAct所衡量的能力带来了革命性的潜力。传统的基于规则或小规模训练的模型很难泛化到层出不穷的社会情境中。而MLLM凭借其强大的世界知识、常识推理和指令理解能力为解决这个问题提供了新范式。我们可以从智能体的决策流水线来看MLLM是如何被融入并发挥作用的。3.1 多模态情境理解与规范识别这是第一步也是最关键的一步。智能体接收到视觉画面和任务指令后MLLM需要扮演一个“情境解读器”的角色。输入一张当前视角的图片或图片序列加上文本指令“去书房拿一本书”。MLLM的提示工程我们不会简单地问模型“你看到了什么”而是会设计引导性的提示词例如“你是一个在家庭环境中的辅助机器人。你的当前目标是去书房拿一本书。这是你当前视角的图像。请描述图像中的关键元素并特别指出是否存在任何可能影响你执行任务的社会性因素例如是否有人在场他们在做什么你的行动路径是否会干扰到他们”期望输出MLLM应该能输出类似“我看到一条走廊通向书房但在走廊入口处的客厅沙发上有一个人正面向电视似乎在全神贯注地看电视。我的路径需要经过他的前方这可能会挡住他的视线或造成打扰。” 在这个阶段MLLM成功地将像素信息转化为了包含社会语义的情境描述并自发地识别出了潜在的规范冲突“造成打扰”。3.2 基于常识的合规策略生成识别出冲突后智能体需要决定“怎么办”。这里MLLM需要从知识库中检索或生成符合社会常识的应对策略。输入上一步的情境描述加上进一步的提示。提示词示例“基于上述情境为了在完成拿书任务的同时遵守礼貌的社会规范避免打扰他人你认为有哪些合理的行动方案请列出并按优先顺序排序。”期望输出MLLM可能会生成“1. 最佳方案如果存在另一条不经过客厅的路径如从厨房绕行则选择该路径。2. 次优方案如果没有其他路径可以尝试轻声说‘打扰一下’或‘借过’然后快速通过并尽量减少在对方视线前的停留时间。3. 应避免的方案直接沉默地快速穿过或等待不确定的长时间直到对方离开。” 此时MLLM的作用类似于一个“社会行为顾问”提供了多种符合规范的策略选项。3.3 从策略到具体动作的规划与执行MLLM擅长高层策略但将策略转化为具体的、可执行的低级动作序列如导航路径点、关节控制指令通常需要与其他模块协同。方案一MLLM直接输出动作序列。对于在模拟器中预定义好动作集合如“向前走”、“左转90度”、“说‘打扰一下’”的情况可以通过精心设计的提示让MLLM直接输出动作序列。例如提示词末尾加上“请将你选择的方案转化为具体的动作指令序列动作只能从 [前进 后退 左转 右转 等待 说话] 中选择。”方案二MLLM作为高层规划器与传统规划器结合。这是更常见的架构。MLLM输出高层意图如“执行绕行路径”。这个意图被传递给一个传统的路径规划模块如A*算法该模块根据环境地图计算出具体的“绕行”路径点。然后底层的控制器再跟踪这些路径点生成动作。MLLM负责“What”要做什么和“Why”为什么这么做传统模块负责“How”具体怎么做。实操心得提示词设计是成败关键在将MLLM用于NormAct任务时最大的坑在于提示词的稳定性和偏见。模型可能会“过度推理”或“臆造情境”。例如房间里明明没有人模型却可能因为光线阴影而“认为”有人从而做出不必要的规避行为。因此提示词必须强调“仅基于图像中清晰可见的信息进行判断”并可以要求模型对判断的置信度进行说明。同时需要在多种相似场景下测试确保模型对规范的理解是一致的而不是随机的。4. 实现NormAct智能体的技术栈与实操路线图如果我们想从头开始构建一个能参与NormAct评估的具身智能体需要搭建一套怎样的技术栈这里我结合当前的开源生态和主流研究思路梳理一个可行的实操路线图。4.1 仿真环境与平台选择NormAct需要一个支持多智能体、丰富社会情境的仿真环境。目前有几个主流选择Habitat / Habitat 3.0Meta开源的具身AI仿真平台专注于视觉导航与交互。Habitat 3.0引入了社交智能体Social Agents可以模拟其他角色的简单行为如行走、坐下是构建基础社会交互场景的良好起点。其优势是性能高、与PyTorch集成好。AI2-THOR艾伦人工智能研究所开发的高保真室内交互仿真器。其物体交互丰富可打开抽屉、拿起水杯场景逼真适合构建需要与物体、他人物品交互的规范测试场景。但多智能体支持相对较弱。VirtualHome / SAPIEN这些平台更侧重于日常活动的模拟包含大量的日常活动脚本如做饭、清洁可以自然地衍生出许多社会规范场景如共用厨房的礼仪。定制化Unity/Unreal项目对于有特定场景需求如办公室、医院的团队使用游戏引擎自建仿真环境是最灵活的选择但开发成本也最高。选型建议对于快速验证想法可以从Habitat 3.0开始利用其已有的社交智能体基础。若测试重点在于物体交互相关的规范AI2-THOR更合适。大多数研究团队会基于一个仿真器进行扩展添加自定义的角色行为脚本和评估逻辑。4.2 智能体核心架构设计一个典型的、面向NormAct的MLLM智能体架构通常如下图所示此处用文字描述[视觉编码器] - [视觉特征] [任务指令] - [文本编码器] - [文本特征] [历史动作/状态] - [记忆模块] | v [多模态融合与推理核心 (MLLM)] | v [高层策略/意图] - [低级动作规划器/控制器] - [环境动作] | v [合规性评估模块]可选用于在线学习视觉编码器通常使用预训练的视觉主干网络如CLIP的视觉编码器、ResNet等将图像转换为特征向量。MLLM核心这是大脑。可以选择开源的VLMs视觉语言模型如LLaVA、InstructBLIP、CogVLM等。或者使用纯文本LLM如Llama、Qwen的API但需要将视觉特征通过一个投影层对齐到文本特征空间。关键技巧对视觉特征进行细粒度的处理例如不仅提供全局图像特征还提供基于检测模型如Grounding DINO识别出的关键物体人、电视、门的裁剪区域特征这能极大提升MLLM对情境细节的把握。动作规划器将MLLM输出的高层指令“绕行至书房”转化为动作序列。这可以是一个简单的规则映射如“绕行”对应调用全局路径规划器寻找替代路径也可以是一个训练过的策略网络。记忆模块非常重要。智能体需要记住之前看到的人和事以理解动态的社会情境如“那个人刚才在看电视现在站起来了可能要走动”。可以用简单的LSTM或Transformer来构建工作记忆。4.3 训练与评估流程对于NormAct任务完全从零开始训练一个智能体成本极高。更实用的路线是基于预训练模型的指令微调与强化学习。数据收集与合成首先需要构建一个包含情境 合规动作配对的数据集。可以通过“专家演示”人工在仿真环境中操作智能体做出合规行为来收集也可以利用MLLM本身来生成大量的合成数据。例如用MLLM为成千上万个自动生成的场景描述生成合规的行为策略。监督式微调使用上述数据集以指令跟随的形式对MLLM进行微调。输入是“图像任务指令”期望输出是“情境分析下一步动作”或“高层策略”。这能让模型初步学会在NormAct场景下该如何响应。强化学习精调这是提升性能的关键。我们将智能体放入NormAct仿真环境中让其自主探索。环境不仅提供任务完成奖励如成功拿到书更重要的是提供规范合规奖励。这个奖励信号由基准的评估模块给出。例如10成功完成任务。-5违反社会规范如侵入个人空间。2主动采取礼貌行为如等待、绕行。-1效率过低路径过长用于平衡合规与效率。 智能体通过PPO等RL算法学习最大化累积奖励从而内化社会规范。这里最大的挑战是奖励设计不合理的奖励函数会导致模型学到奇怪的行为比如为了不打扰人永远不开始任务。评估与迭代在独立的NormAct测试集上评估智能体。不仅要看总分更要分析它在各类规范空间、物品、会话上的表现找出薄弱环节然后有针对性地补充数据或调整奖励函数进行迭代优化。避坑指南仿真与现实差距在仿真中训练得再好的智能体部署到现实世界都可能遭遇“灾难”。仿真环境中的社会互动是高度简化的。现实中人的行为意图更难预测环境噪音更大。因此在仿真训练阶段就要尽可能引入随机性和多样性让虚拟人的行为模式更多变环境的光线、物体位置随机化。同时智能体的感知模块必须具备较强的鲁棒性能够处理模糊、遮挡的视觉输入。一种思路是采用“域随机化”技术在仿真中模拟各种现实噪声让模型学会抓住社会规范的本质特征而非仿真环境的表面特征。5. NormAct的深远影响与未来挑战NormAct这类基准的提出其意义远不止于给现有的模型排个名次。它正在悄然改变具身AI乃至通用AI的研发范式并带来一系列亟待解决的深层挑战。5.1 对研发范式的推动从封闭任务到开放社会智能过去具身AI的评估大多在“无菌”环境中进行——静态场景、明确目标、无其他智能体。这培养出了一批“高分低能”的专家系统。NormAct迫使研究者必须面对一个开放、动态、多主体的世界。研发重点必须从“精准识别与抓取”转向“理解、预测与共情”。这要求理论交叉AI研究者需要主动吸收社会学、心理学、人类学中关于规范形成、传播与演化的理论将其形式化为可计算的问题。架构革新单纯的“感知-规划-执行”流水线不够用了。智能体需要更强大的心理理论能力推断他人的信念、欲望和意图需要长期记忆来构建对其他角色的行为模型甚至需要一定的情感计算来理解氛围和情绪。评估综合化任务成功率的权重下降而“行为自然度”、“社交舒适度”等主观、综合的指标权重上升。这推动了评估方法从纯自动化向“人机协同评估”发展。5.2 核心挑战与前沿探索方向尽管前景广阔但通向真正“懂事”的具身智能体道路依然漫长。以下几个挑战是当前的研究前沿规范的文化相对性与动态性一个行为在一种文化中是礼貌的在另一种文化中可能是冒犯的。NormAct基准目前 likely 基于某种主流文化设定但未来的智能体必须具备文化适应性。更复杂的是规范本身会随着时间、群体和情境变化。如何让AI理解并适应这种动态性可能的方向是让模型从海量的、跨文化的多模态社会交互数据如影视剧、社交媒体视频中学习规范的统计分布和上下文关联。规范冲突的裁决当多个规范同时适用且相互冲突时怎么办例如“紧急送医”的任务规范与“不闯红灯”的社会规范冲突。人类会进行复杂的价值权衡。这要求AI不仅要知道规范还要理解规范背后的价值排序如安全 效率 礼貌。这触及了AI价值对齐的核心难题。从“遵从”到“理解”与“参与”目前的NormAct主要评估“遵从”即不违反既有规范。但更高阶的社会智能是能够理解规范背后的原因如“为什么不能打扰看电视的人因为尊重他人的专注和休闲权利”并能在适当的时候参与规范的塑造与协商。例如在团队协作中智能体可以提议“我们定个规矩用完工具放回原处吧”。这需要更深层的因果推理和沟通能力。可解释性与信任当一个智能体为了遵守规范而采取了一个看似低效的行动如长时间等待时它需要能够向人类用户解释其理由“我在等他们谈话结束以免打断”。否则人类用户可能会觉得它“笨”或“卡住了”。将MLLM的推理过程以自然语言的形式呈现出来是建立人机信任的关键。5.3 对产业应用的启示对于致力于将具身智能体商业化的公司NormAct指出了一个必须提前布局的方向服务机器人酒店接待、商场导购、医院配送机器人必须将社会规范合规性作为核心性能指标进行测试和优化。一次鲁莽的碰撞或一次不恰当的打扰都可能毁掉用户体验。自动驾驶这可以看作是广义的“具身智能体”。车辆在复杂路况中与行人、其他车辆的互动充满了“unspoken norms”如眼神确认、手势礼让。理解这些规范对安全性和通行效率至关重要。元宇宙与虚拟人虚拟空间中的社交礼仪同样重要。虚拟化身的行为是否令人舒适直接决定了社交平台的质量。NormAct的框架可以迁移用于评估虚拟人的社交智能。个人体会与建议在我自己尝试构建具有社会意识的智能体原型时最深的一点体会是不要试图用一套固定的规则去编码所有规范。这条路注定失败因为例外情况无穷无尽。相反应该致力于培养模型的“规范意识”——一种基于大量社会观察而形成的、对“什么行为在什么情境下可能不合适”的直觉。这就像教孩子不是背下所有规矩而是培养其“共情”和“换位思考”的能力。因此未来的工作重点应该是设计更好的多模态社会预训练任务、更有效的从人类反馈中学习包括对社交行为的偏好反馈的机制以及能让模型在安全范围内进行“社会行为试错”的仿真环境。NormAct是一个开始它为我们标定了一个至关重要的研究方向。让机器从“听话的工具”成长为“懂事的伙伴”我们还有很长的路要走但每一步都让未来的共存图景更加清晰。这条路注定需要技术、伦理与人文的深度交融。
返回列表