摘要
本发明公开了一种面向具身智能场景的多轮人机对话需求澄清方法,属于人机交互技术领域;方法为:接收用户的自然语言初始指令,并将指令内容与实时的多模态上下文信息进行初步融合;通过歧义检测模块,评估当前指令是否满足任务执行的完备性条件;整合初始指令及所有交互轮次中获取的全部信息,形成最终任务意图;采用结构化的行动计划,对最终任务意图进行解析至完成任务。本发明通过多模态情境融合机制与结构化歧义检测模块,解决因缺乏真实世界感知、依赖预设模板而导致的意图理解浅显、无法处理未知模糊指令的难题;利用大语言模型生成任务必要参数清单,将不明确的指令量化为具体的缺失要素,提升了对用户真实意图的理解深度与准确性。