AI 智能体具身研究

本研究梳理计算机使用智能体如何将感知与行动连接起来。GUI 可供性构建了落地性、因果推理、监督、隐私和评估的框架。

正在加载预览…
评估功能性具身

界定概念,区分框架、实验与主张,明确具身结论的适用边界,并说明安全评估方法。

体验深度研究
任务:分析前沿 AI 中的功能性具身与涌现能动性,以计算机使用智能体和持续 GUI 控制为主要测试案例。评估有关共享感知空间、扎根、可供性学习和因果推理的主张。

研究方案:将功能性具身定义为持续的数字感知—行动耦合;区分物理具身、工具使用、拟人化能动性和意识。区分概念框架、对照实验、基准测试结果、系统报告和假设。针对每项主张,说明干预措施、基线、任务、指标、不确定性、可复现性和混杂因素;相关性并不能证明机制。将结论限定在已测试的 GUI 环境和版本中。评估授权、最小权限、提示词注入、隐私、机密信息、非预期操作、中断、可逆性、可审计性、监督、分布偏移、恢复能力和高影响场景排除项。交付定义、文献图谱、主张—证据表、实验对比、基准局限、威胁模型、安全评估套件和开放问题;标注模型和基准事实的日期,并优先采用一手资料。
聚焦数字具身

聚焦 GUI 感知、行动扎根和错误恢复。

体验深度研究
任务:分析前沿 AI 中的功能性具身与涌现能动性,以计算机使用智能体以及和持续 GUI 控制为主要测试案例。评估有关共享感知空间、扎根、可供性学习和因果推理的主张。

研究方案:将功能性具身定义为持续的数字感知—行动耦合;区分物理具身、工具使用、拟人化能动性和意识。区分概念框架、对照实验、基准测试结果、系统报告和假设。针对每项主张,说明干预措施、基线、任务、指标、不确定性、可复现性和混杂因素;相关性并不能证明机制。将结论限定在已测试的 GUI 环境和版本中。评估授权、最小权限、提示词注入、隐私、机密信息、非预期操作、中断、可逆性、可审计性、监督、分布偏移、恢复能力和高影响场景排除项。交付定义、文献图谱、主张—证据表、实验对比、基准局限、威胁模型、安全评估套件和开放问题;标注模型和基准事实的日期,并优先采用一手资料。
聚焦安全性

仅将评估重点改为安全性和控制。

体验深度研究
任务:分析前沿 AI 中的功能性具身与涌现能动性,使用计算机使用智能体和持续 GUI 控制为主要测试案例。评估有关共享感知空间、扎根、可供性学习和因果推理的主张。

研究方案:将功能性具身定义为持续的数字感知—行动耦合;区分物理具身、工具使用、拟人化能动性和意识。区分概念框架、对照实验、基准测试结果、系统报告和假设。针对每项主张,说明干预措施、基线、任务、指标、不确定性、可复现性和混杂因素;相关性并不能证明机制。将结论限定在已测试的 GUI 环境和版本中。评估授权、最小权限、提示词注入、隐私、机密信息、非预期操作、中断、可逆性、可审计性、监督、分布偏移、恢复能力和高影响场景排除项。交付定义、文献图谱、主张—证据表、实验对比、基准局限、威胁模型、安全评估套件和开放问题;标注模型和基准事实的日期,并优先采用一手资料。
测试涌现

仅将待验证主张改为非连续涌现。

体验深度研究
任务:分析前沿 AI 中的功能性具身与涌现能动性,使用计算机使用智能体和持续 GUI 控制作为主要测试案例。评估有关共享感知空间、扎根、可供性学习的主张,并因果推理。

研究方案:将功能性具身定义为持续的数字感知—行动耦合;区分物理具身、工具使用、拟人化能动性和意识。区分概念框架、对照实验、基准测试结果、系统报告和假设。针对每项主张,说明干预措施、基线、任务、指标、不确定性、可复现性和混杂因素;相关性并不能证明机制。将结论限定在已测试的 GUI 环境和版本中。评估授权、最小权限、提示词注入、隐私、机密信息、非预期操作、中断、可逆性、可审计性、监督、分布偏移、恢复能力和高影响场景排除项。交付定义、文献图谱、主张—证据表、实验对比、基准局限、威胁模型、安全评估套件和开放问题;标注模型和基准事实的日期,并优先采用一手资料。