从命令到委派:AI Agent 交互范式转移
摘要:当 AI 从“按指令响应”转向“围绕目标自主拆解任务、调用工具、协调资源并跨时间执行”时,HCI 的分析对象正从单次的“输入-输出”回合,转变为**可检验、可追踪、可中断的委派关系**。
Agentic Interaction 由任务规划、工具调用、长期记忆、多智能体协作、权限治理、可观察性与人类审批共同支撑。这种转变重塑了界面、用户角色、评估指标与责任结构:用户从操作员转变为授权者与监督者,**设计重点也从提升效率,扩展到信任校准、可中断性、可恢复性、权责追溯与权限最小化**。
本文提出一个以**委托契约与关系治理**为中心的人机协作框架,将系统拆解为目标、计划、执行、监督、记忆与治理层,并通过生命周期、错误类型和可控边界来管理 Agentic Interaction。
范式迁移与对比
在 Command-based interaction 中,用户通过显式命令或直接操控发起任务,系统在少数几轮交互内返回结果。此时控制权主要掌握在用户手中,系统自身缺乏自治、跨工具协同与持续执行的能力。Shneiderman 在定义 direct manipulation 时,强调了对象可见、增量操作、可逆操作和用户控制 [1];Horvitz 则指出“自动化服务”与“用户主导”需要谨慎结合 [2]。这两类观点共同奠定了 Command-based 范式的基础。
Delegation/Agentic interaction 则可以这样定义:用户不再逐步指定每个动作,而是以目标、约束、权限、偏好和验收标准为核心,系统自己分解任务、选择工具、调用外部资源,在高风险节点主动请求人类批准。

从 HCI 的角度看,两者的差异不仅是“自动化程度”,而是谁定义目标、谁控制过程、谁恢复异常、谁掌控追责证据,全都改变了。1997 年,Shneiderman 与 Pattie Maes 曾围绕 direct manipulation 与 interface agents 展开争论 [3]。时隔三十年,这一问题再次出现:用户是希望保留全部控制权,还是愿意把复杂性外包给智能体,再通过更高层级的边界与反馈来管理它?
| 维度 | Command-based interaction | Delegation / Agentic interaction |
|---|---|---|
| 系统角色 | 工具 / 执行器 | 智能体 / 承办者 / 协调者 |
| 用户角色 | 操作员、编辑者 | 授权者、监督者、审批者、纠偏者 |
| 基本单位 | 单次命令、单回合反馈 | 一次委托事件与其完整生命周期 |
| 目标表达 | 用户指定步骤或局部动作 | 用户指定目标、约束、权限、成功条件 |
| 信息流 | 用户给出指令,系统回结果 | 用户给契约,系统持续回传计划、进度、异常、证据 |
| 控制流 | 用户主导,系统被动响应 | 控制在用户设边界后下放,过程可中断、可升级 |
| 时间尺度 | 短时、回合内 | 长时、多步、跨会话 |
| 外部行动 | 弱或无 | 强,依赖工具、API、浏览器、代码执行、子智能体 |
| 失败形态 | 结果不准、理解偏差 | 理解偏差、计划偏差、工具失败、权限越界、级联错误 |
| 评估重点 | 可学性、效率、结果质量 | 结果质量 + 信任校准 + 可中断性 + 可恢复性 + 审计性 |
| 设计重心 | 输入与输出界面 | 委托契约、运行时治理、审批与追踪界面 |
Interaction 作为 HCI 的核心词汇,主导了这个领域几十年。而今天,interaction 开始退居为 delegation 的操作表层,delegation relation 成为更能解释 agentic 系统行为的分析单位。
能力与技术基础
Agentic Interaction 至少依赖七类关键能力:

| 能力 | 关键贡献 | 对交互范式的意义 |
|---|---|---|
| 任务拆解与计划 | 把思考、规划、执行编织成多步工作流 | 用户可委托目标,而非手写步骤 |
| 工具调用 | 决定何时、如何调用外部能力 | 交互对象扩展到真实世界系统 |
| 模块化推理 | 把语言、知识、离散推理分层 | 智能体可按能力路由,而非单模型硬扛 |
| 长期记忆 | 跨会话存取与上下文分层管理 | 委托可以跨时持续,而非一次性完成 |
| 多智能体协作 | 编排、并行化、能力发现与协作协议 | 用户面对的是协作体,不是单一界面对象 |
| 监督与中断 | 暂停、审批、恢复成为一等机制 | 高风险操作可由人接管 |
| 追踪与评估 | 结果、工具轨迹、guardrails 可评分 | 评估基本单位从响应质量扩展到流程质量 |
HCI 影响与评估
“大输入框 + 一段输出”的界面模式,已经无法支撑智能体的长期运行。处理长时复杂任务时,系统不能把“计划”藏在内部状态里,而必须将它变成一个共享对象,由人与智能体共同编辑和执行。同时,用户在使用多智能体系统时,需要清楚智能体之间如何通信、如何识别冲突,以及系统分为几层架构;否则,系统的透明性、可解释性和安全感都会迅速下降 [4]。
这会重塑用户的心理模型。
Command-based 范式下,用户往往把系统当成“会生成答案的工具”;而 Delegation 范式更接近“被授权的合作者”,任务委托、自治与控制、可理解性、共同基础和求助/提供帮助成为关键。这意味着用户不再只关心回答得准不准,还会问“它懂不懂我的边界、何时该请示、何时该自作主张”。
传统 AI assistance 往往把建议打包成一个整体,用户只能全盘接受或全盘拒绝,无法逐条讨论并修改有争议的内容;deliberation 式交互则可能提升决策准确率 [32]。对 agentic 系统来说,这一点尤其关键:用户要的不是更长的 explanation,而是可协商的计划与可争论的理由。
在建立信任时,Lee 与 See 的经典结论依然成立:关键不在于让用户更多地依赖自动化,而在于让依赖恰到好处 [21]。Dietvorst 关于“算法厌恶”的研究表明,即便人们知道算法平均来看更准确,只要看到它出错,依然可能转而选择效果更差的人类判断 [22]。将这一现象应用到 Agentic Interaction 中,有三个设计原则尤为关键:让能力边界清晰可见、降低纠偏成本,以及让人保留有限但有效的干预权。
确定责任时,焦点已从追踪个人的点击记录,转向治理整条委托链。智能委托框架在定义委托时,就写入了 authority、responsibility 和 accountability [23];EU AI Act 第 14 条要求高风险 AI 必须支持有效的人类监督,使人类能够理解系统的能力与局限、避免过度依赖,并可随时覆盖或停止系统 [24];NIST AI RMF 则将 accountability、transparency、privacy-enhanced 以及 secure and resilient 列为可信 AI 的核心特征 [25]。换言之,在 Agentic HCI 中确定“谁该负责”,不能只问输出来自谁,更要问:谁设定了权限,谁批准了动作,谁保存了痕迹,谁握有停止权。
隐私与安全也被重新定义。MCP 官方安全文档讨论了 confused deputy 等问题,授权规范要求基于 OAuth 的发现与元数据机制 [26];针对 delegated critical tasks 的新研究指出,现有网站对 agentic AI 的访问控制仍很有限,需要细粒度授权 [27];CHI 2026 的隐私管理研究表明,用户对跨应用、跨关系、跨时间情境的隐私控制极度碎片化,反而会把自治度更高的 agent 看作整合碎片的可能方案 [28]。Agent 的价值来自更深的接入能力,风险也恰恰来自于此。

因此,Agentic Interaction 需要新的评估指标。任务完成时间、SUS、点击次数这些传统指标仍有价值,但已经不够。评估指标可以扩展如下:
| 指标 | 核心问题 | 可能测量方法 |
|---|---|---|
| 委托清晰度 | 用户是否清楚委托目标、边界与成功标准 | 任务前问卷 + 计划复述一致率 |
| 边界对齐率 | 智能体是否在预算、权限、风格与风险边界内行动 | trace 审计、违规率、越权率 |
| 信任校准度 | 用户的信任是否与系统真实能力匹配 | 依赖/覆盖行为与真实成功率差值 |
| 可中断性 | 用户能否在关键节点及时介入 | 审批响应时延、停止成功率 |
| 可恢复性 | 出错后能否从中间状态继续 | resume 成功率、恢复成本 |
| 过程可追溯性 | 用户/团队能否理解发生了什么 | 轨迹理解测试、解释满意度、trace 完整率 |
| 权限最小化 | 系统是否只拿到完成任务所需最少权限 | 权限域审计、敏感资源暴露面 |
| 纠偏成本 | 用户修正智能体偏差所需努力 | 人工修订步数、重新委托次数 |
| 长程稳定性 | 多会话、多工具、多智能体下行为是否持续稳定 | 周期性 eval、漂移检测 |
| 最终结果质量 | 是否达到业务/研究/学习目标 | outcome-based grader、专家评审、人类 A/B |
Agentic Interaction 框架
以委托契约为核心,以可见计划为中介,以受控执行为主线,以追踪与审批为治理层。

契约、证据、审批、记忆这四层与执行层并列。Agentic Interaction 把传统 UI、workflow engine、日志系统、权限系统和协作界面,组合成一个新型的人机关系编排器。
组件、接口与协议
| 模块 | 作用 | 关键实现要点 |
|---|---|---|
| 委托契约 | 定义目标、约束、预算、风险级别、验收标准 | 目标表达、权限范围、审批规则、退出条件 |
| 计划层 | 任务拆解、候选方案、步骤分配 | 人可读计划、可编辑步骤、任务分派 |
| 编排层 | 决定单智能体 / 多智能体 / 代码流程 | LLM 决策编排与代码编排混合 |
| 工具与数据层 | API、数据库、浏览器、检索、代码执行 | schema 严格、权限分级、最小暴露面 |
| 监督层 | 审批、中断、纠偏、停止 | sensitive action approval、override、resume |
| 追踪层 | 记录模型调用、工具调用、hand-off、guardrail | run trace、grader、可审计日志 |
| 记忆层 | 短期状态与长期上下文管理 | 会话记忆、项目记忆、客观证据存档 |
| 界面层 | 计划视图、轨迹视图、审批视图、结果视图 | 让“过程对象”成为一级 UI 元素 |
协议上,建议用 MCP 处理 agent↔tools/data [26],用 A2A 处理 agent↔agent [16],用 AG-UI 或同类事件层处理 agent↔frontend [29];如果需要远端智能体安全地生成 UI,可以引入 A2UI 一类声明式 UI 规范 [30]。这样做是为了把“工具接入”“智能体协作”“用户表层”解耦,避免所有逻辑都堆积在单一聊天界面。
状态与生命周期

之所以强调生命周期,是因为 agentic 系统的主要 UX 问题,常常不出在一次回答,而出在中途等待、异常恢复、权限升级、结果验收和跨会话继续这些传统聊天 UI 不擅长的环节。OpenAI 的 run state / interruptions / resume [17],Anthropic 的长期智能体工程经验 [15],都说明“把生命周期可视化”是 agentic UX 的必要条件。
错误处理与可控性边界
错误处理至少应分六类:意图理解错误、计划错误、工具错误、权限错误、状态漂移、价值/规范错配。前四类主要靠 trace、grader、approval 与 retry 处理;后两类更依赖人类重新界定契约、动用中止权。
可控性边界可以来自时间、成本、资源、权限、风险、价值。只有把这些边界提升为一级配置项,用户才是在“委托”,而不是在碰运气。
What’s next?
短期最紧迫的问题是:不同的自治级别、审批方式、解释粒度与界面暴露层次,会如何影响用户的信任校准、纠偏行为与任务成功?
中期的问题是:在多智能体架构里,哪种“监督智能体 + 子智能体”的分工最容易让用户理解和治理?
长期的问题则是:随着 Agent 在组织里普及,HCI 是否要从单用户可用性,扩展到人—智能体—制度三层协同设计。
| 时间尺度 | 关键研究问题 | 实验设计建议 | 可用指标 | 候选基准/数据集 |
|---|---|---|---|---|
| 短期 | 何种委托界面最能形成正确心理模型 | 对比“聊天式 / 计划板式 / 审批流式”界面;within-subject | 委托清晰度、纠偏成本、信任校准度 | GAIA [33]、AssistantBench [37]、小型真实任务集 |
| 短期 | 审批机制放在何处最有效 | 比较事前全审批、风险触发审批、事后审计 | 中断负担、越权率、任务成功率 | WebArena [34]、企业模拟流程 |
| 中期 | 多智能体可视化如何影响理解与依赖 | 比较隐藏式多智能体 vs 显式角色/通信轨迹 | 架构理解、角色混淆率、覆盖率 | 多智能体研究任务 [15][31]、A2A demo [16] |
| 中期 | 记忆机制如何影响长期协作 | 比较无记忆、短期记忆、长期项目记忆 | 连续任务成功率、重复解释成本、隐私顾虑 | 长程研究、项目管理任务 |
| 中期 | 过程证据是否比最终解释更重要 | 对比“答案解释”与“执行轨迹 + 证据链” | 解释可用性、审计效率、信任校准 | 开放研究任务、决策支持任务 |
| 长期 | 委托关系如何进入组织治理 | 研究 agent 身份、权限、责任与合规衔接 | 责任可归因率、审计通过率、组织接受度 | 企业日志、合规流程数据 |
| 长期 | HCI 能否形成 delegation-native 理论 | 比较 interaction-centered 与 relation-centered 模型解释力 | 理论解释覆盖面、设计预测力 | 跨领域纵向研究 |
当 AI 拥有任务拆解、工具调用、记忆与协调能力时,HCI 的核心应当从“输入-输出交互”上移到“人与智能体之间的委托关系”;但交互并没有消失,它变成了建立、监督、修订和终止委托关系的界面机制。 这需要一个 Agentic Interaction 总框架 来承载:以委托契约为核心、以协议互操作为骨架、以计划和轨迹为界面对象、以审批与审计为治理底盘、以评估飞轮为持续改进机制。
References
[1] Ben Shneiderman. “Direct Manipulation: A Step Beyond Programming Languages.” IEEE Computer, 1983. https://doi.org/10.1109/MC.1983.1654471
[2] Eric Horvitz. “Principles of Mixed-Initiative User Interfaces.” CHI ‘99, 1999. https://doi.org/10.1145/302979.303030
[3] Ben Shneiderman and Pattie Maes. “Direct Manipulation vs. Interface Agents.” Interactions, 1997. https://doi.org/10.1145/267505.267514
[4] Saleema Amershi et al. “Guidelines for Human-AI Interaction.” CHI ‘19, 2019. https://doi.org/10.1145/3290605.3300233
[5] Shunyu Yao et al. “ReAct: Synergizing Reasoning and Acting in Language Models.” arXiv, 2022. https://arxiv.org/abs/2210.03629
[6] Yongliang Shen et al. “HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face.” arXiv, 2023. https://arxiv.org/abs/2303.17580
[7] OpenAI. “OpenAI Agents SDK.” https://openai.github.io/openai-agents-python/
[8] Timo Schick et al. “Toolformer: Language Models Can Teach Themselves to Use Tools.” arXiv, 2023. https://arxiv.org/abs/2302.04761
[9] Anthropic. “Tool use with Claude.” https://platform.claude.com/docs/en/agents-and-tools/tool-use/overview
[10] OpenAI. “Using tools.” https://developers.openai.com/api/docs/guides/tools
[11] Ehud Karpas et al. “MRKL Systems: A Modular, Neuro-Symbolic Architecture…” arXiv, 2022. https://arxiv.org/abs/2205.00445
[12] Charles Packer et al. “MemGPT: Towards LLMs as Operating Systems.” arXiv, 2023. https://arxiv.org/abs/2310.08560
[13] Anthropic. “Memory tool.” https://platform.claude.com/docs/en/agents-and-tools/tool-use/memory-tool
[14] Qingyun Wu et al. “AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation.” arXiv, 2023. https://arxiv.org/abs/2308.08155
[15] Anthropic. “How we built our multi-agent research system.” 2025. https://www.anthropic.com/engineering/multi-agent-research-system
[16] A2A Protocol. “Agent2Agent Protocol Specification.” https://a2a-protocol.org/latest/specification/
[17] OpenAI. “Agents SDK: Human-in-the-loop / run state.” https://openai.github.io/openai-agents-python/human-in-the-loop/
[18] OpenAI. “Agents SDK: Tracing.” https://openai.github.io/openai-agents-python/tracing/
[19] OpenAI. “Working with evals.” https://developers.openai.com/api/docs/guides/evals
[20] Anthropic. “Using the Evaluation Tool.” https://platform.claude.com/docs/en/test-and-evaluate/eval-tool
[21] John D. Lee and Katrina A. See. “Trust in Automation: Designing for Appropriate Reliance.” Human Factors, 2004. https://doi.org/10.1518/hfes.46.1.50_30392
[22] Berkeley J. Dietvorst, Joseph P. Simmons, and Cade Massey. “Algorithm Aversion: People Erroneously Avoid Algorithms after Seeing Them Err.” Journal of Experimental Psychology: General, 2015. https://doi.org/10.1037/xge0000033
[23] Nenad Tomašev, Matija Franklin, and Simon Osindero. “Intelligent AI Delegation.” arXiv, 2026. https://arxiv.org/abs/2602.11865
[24] European Union. “Regulation (EU) 2024/1689, Artificial Intelligence Act.” https://eur-lex.europa.eu/eli/reg/2024/1689/oj
[25] NIST. “Artificial Intelligence Risk Management Framework (AI RMF 1.0).” 2023. https://doi.org/10.6028/NIST.AI.100-1
[26] Model Context Protocol. “Security Best Practices” and “Authorization.” https://modelcontextprotocol.io/docs/tutorials/security/security_best_practices ; https://modelcontextprotocol.io/specification/2025-06-18/basic/authorization
[27] Sunyoung Kim and Hokeun Kim. “Access Controlled Website Interaction for Agentic AI with Delegated Critical Tasks.” arXiv, 2026. https://arxiv.org/abs/2603.18197
[28] Eryue Xu and Tianshi Li. “From Fragmentation to Integration: Exploring the Design Space of AI Agents for Human-as-the-Unit Privacy Management.” arXiv, 2026. https://arxiv.org/abs/2602.05016
[29] AG-UI. “Agent User Interaction Protocol.” https://docs.ag-ui.com/introduction
[30] Fancy Kong et al. “Macaron-A2UI: A Model for Generative UI in Personal Agents.” arXiv, 2026. https://arxiv.org/abs/2605.24830
[31] K. J. Kevin Feng et al. “Cocoa: Co-Planning and Co-Execution with AI Agents.” arXiv, 2024. https://arxiv.org/abs/2412.10999
[32] Shuai Ma et al. “Towards Human-AI Deliberation: Design and Evaluation of LLM-Empowered Deliberative AI for AI-Assisted Decision-Making.” arXiv, 2024. https://arxiv.org/abs/2403.16812
[33] Grégoire Mialon et al. “GAIA: A Benchmark for General AI Assistants.” arXiv, 2023. https://arxiv.org/abs/2311.12983
[34] Shuyan Zhou et al. “WebArena: A Realistic Web Environment for Building Autonomous Agents.” arXiv, 2023. https://arxiv.org/abs/2307.13854
[35] Carlos E. Jimenez et al. “SWE-bench: Can Language Models Resolve Real-World GitHub Issues?” arXiv, 2023. https://arxiv.org/abs/2310.06770
[36] Yujia Qin et al. “ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs.” arXiv, 2023. https://arxiv.org/abs/2307.16789
[37] Ori Yoran et al. “AssistantBench: Can Web Agents Solve Realistic and Time-Consuming Tasks?” arXiv, 2024. https://arxiv.org/abs/2407.15711