计算机使用 Agent 入门原理:感知-思考-行动循环怎么让 AI 学会用鼠标键盘

山止川行AI 前沿2026-09-18160 阅读💛 5 收藏

计算机使用 Agent 是能像人一样操作电脑的 AI 程序:看屏幕、动鼠标、点按钮、敲键盘。

用大白话说:我们给它一个目标,它就用电脑替我们完成这个目标。

把它拆开看名字就清楚了:Computer 是带屏幕、鼠标、键盘的机器。

Use 是像我们一样真正去操作那台机器。

Agent 是让它自己一步步朝着目标行动,不需要我们指挥每一次点击。

打个比方,我们告诉它”打开浏览器,订今晚 7 点两人的餐位”。

它会自己找到浏览器图标、点开、输入网址、填表、点预订按钮。这些点击我们没有写一行代码,只给了目标。

为什么需要计算机使用 Agent

在没有它之前,让程序自动在电脑上干活对我们来说很难。

假设想让程序自动订那个餐位,有两条老路可走,两条都有问题。

路线一:给每一步写脚本

代码写死”点这里、输这个、点那里”。只在界面永不变时有效——网站一改版,按钮挪了位,我们的代码就点错地方。

这个路线的问题本质:脆弱,一碰就断。看看下一条路线怎么解决。

路线二:走 API 这扇专用门

API 是网站或应用提供给程序的直连通道,可靠又快。但问题在于:不是每个应用都开这扇门。

对不开门的应用,我们束手无策。

于是计算机使用 Agent 来救场了。

它不需要专用门。它用和人一样的屏幕、鼠标、键盘——只要人能看着屏幕完成的任务,它理论上也能做。这是核心思想,也让事情变简单了。

对开了 API 门的应用,MCP 这样的开放标准给模型提供了比点屏幕可靠得多的统一接入方式,两者互补而非替代。

感知-思考-行动循环

每个计算机使用 Agent 都跑在同一个简单循环上:感知——看当前屏幕;思考——决定下一个动作;行动——在电脑上执行该动作。

行动之后,屏幕就变了。于是 Agent 再看一次、再想一次、再动一次。

循环一直转到目标达成为止。别担心,下面我们把三个步骤逐一展开。

拿玩电视游戏的人打比方就明白了。

这个人看屏幕、决定跳跃、按跳跃键。屏幕更新后,他再看一次、决定下一个动作。计算机使用 Agent 的工作方式跟这个人一模一样。

人类玩家计算机使用 Agent
感知眼睛看屏幕给屏幕拍截图
思考大脑决定下一步AI 模型决定下一个动作
行动手按按钮向电脑发送点击或按键

Agent 怎么看屏幕

Agent 没法像我们一样用眼睛看屏幕。

于是系统给屏幕拍截图——一张记录当前屏幕画面的图片——发给 AI 模型。

用大白话说:截图就是 Agent 的眼睛。

这里的模型是视觉模型。视觉模型能看一张图片并理解里面有什么:读出屏幕上的文字、找到按钮、理解布局。

但问题来了:模型必须知道屏幕上元素的精确位置,才能点击它们。

屏幕用像素度量——组成画面的微小圆点。屏幕上每个位置都有一个用两个数字表示的地址:水平位置和垂直位置,写成 (x, y)。

x 向右增长,y 向下增长。

模型看截图找到按钮后,报告它的地址,比如 (640, 400),电脑就知道往哪点。

有些 Agent 还会读屏幕上所有元素的隐藏文本清单,叫无障碍树

它就是一份平铺的清单,写着”位置 (x,y) 有一个名叫搜索的按钮”。这帮 Agent 不用瞎猜就能定位元素。

很多 Agent 把截图和这份清单两者并用。

Agent 怎么决定下一步

现在 Agent 能看了,它必须决定下一个动作。这就是思考步。

这里登场的是一种特殊的 AI 模型:建立在大语言模型之上。大语言模型是训练出来理解语言并用语言推理的 AI。

把语言能力与前一步的视觉模型结合,同一个模型既能看屏幕,又能用文字推理下一步。

给模型三样东西:目标(大白话的任务描述)、当前截图(屏幕现在的样子)、历史(已执行的动作序列)。

模型看三样答一个问题:“哪一个动作让我离目标更近一步?”

比如模型想:“目标是订餐位。屏幕显示浏览器,浏览器没开。所以下一步是点 (50, 760) 处的浏览器图标。”

注意模型不是一次定完所有步骤,只定下一步。

这一点很重要。因为行动之后屏幕会变,新截图可能跟模型预期的不同。一次只定一步,让 Agent 保持灵活。

Agent 就是这样思考的。

Agent 怎么执行动作

模型已经用文字决定了动作。但光有文字点不动鼠标。

于是系统把模型的决策翻译成电脑能执行的真实指令。

Agent 能执行的基本动作集与人日常操作相同:click(x, y) 点坐标、type(“文字”) 输入、scroll(方向) 滚动、key(“Enter”) 按特殊键、screenshot() 拍新截图。

模型用干净的结构化形式输出选择,方便系统读取。这种形式叫 JSON——一种用标签和值写数据的简单方式,程序一看就懂。

例如返回这样的结构:reasoning 字段解释为什么选这个动作(帮我们信任它),action 字段是 click,x=50、y=760 是点击地址。

系统读取后,在 (50, 760) 执行一次真实的鼠标点击。

浏览器打开,新截图拍下,循环继续。

Agent 就这样把决策变成电脑上的真实动作。

五步实例:搜伦敦天气

学这个最好的方式就是来一个例子。假设我们的目标是:“搜伦敦的天气”。

我们把循环一步一步走一遍。

第 1 步:系统截图。屏幕是带浏览器图标的桌面。

模型想:“我需要浏览器。我先点浏览器图标。“返回点击图标的动作。系统点击,浏览器打开。

第 2 步:新截图拍下。模型看到一个带空地址栏的浏览器。

模型想:“我先点地址栏。“返回点击地址栏。系统点击。

第 3 步:新截图。地址栏已激活。

模型想:“现在输入搜索词。“返回 type 动作,文本是”伦敦天气”。系统输入。

第 4 步:新截图。文字已在地址栏里。

模型想:“按 Enter 开始搜索。“返回 key 动作 Enter。系统按下。

第 5 步:新截图。搜索结果显示了伦敦天气。

模型想:“目标完成。“返回 done 动作,循环停止。

模型看到执行动作
1带浏览器图标的桌面点浏览器图标
2空浏览器点地址栏
3地址栏激活输入”伦敦天气”
4文字已输入按 Enter
5天气结果done

规律清晰:看、定一个动作、做、再看。

Agent 从不预先规划全部五步,而是对每张新截图做反应。

这就是为什么界面表现得出乎意料时,它依然能工作。我们就用这个循环解决了”操作任意应用”这个有趣问题。

系统提示词与工具

现在问题来了:模型怎么知道允许做哪些动作?

答案是系统提示词工具

系统提示词是任务开始前给模型的一组起始指令,告诉模型它是谁、必须怎么行动。

用大白话说:系统提示词就是 Agent 的规则手册。

一份简化版示例告诉模型三件要事:身份(计算机使用 Agent)、允许的动作清单(click、type、scroll、key、screenshot)、回复格式(结构化 JSON,每个动作前解释推理,目标完成即停止)。

允许动作的清单常被称为 Agent 的工具

一个工具就是 Agent 能用的一项能力,比如点击或输入。模型按步骤挑对的工具。

模型就这样在上场前了解自己的角色和权限。

安全护栏

计算机使用 Agent 能在真实电脑上做真实操作,安全极重要。

假设 Agent 正在填一个表单,来到一个写着”删除账号”的按钮前。

我们不想让它不经允许就点下去。

于是护栏登场。护栏是阻止 Agent 擅自执行危险动作的安全规则。

几个常见护栏:人工批准——支付、删数据这类危险动作,Agent 先暂停征求我们的同意。

封锁动作——有些动作比如改系统设置,直接禁止。

受限区域——Agent 常跑在一个安全的独立空间里,碰不到我们的重要个人文件。

这些护栏确保 Agent 保持有用、不造成伤害。敏感任务上,我们必须始终让人类掌控。

四条局限

学完了原理,也该了解它的边界。计算机使用 Agent 很强,但不完美。

:每步都要截图加模型决策,多步就是多轮等待。

会出错:模型可能看错屏幕点错按钮。

会卡死:界面混乱时可能反复尝试同一动作。

成本高:每步看图加推理消耗大量算力。

所以现阶段,我们主要在没有 API 这扇专用门的任务上用它。

API 可用时优先走 API——更快更可靠。

技术进步非常快:看屏幕、决定动作、从错误中恢复,Agent 都在持续变强。

结语

计算机使用 Agent 看屏幕、定一个动作、执行,循环往复直到目标达成——这就是感知-思考-行动循环。它用视觉模型看、语言模型推理、click/type 这样的小动作集行动。

这个想法的美妙之处很简单。

只要人能看着屏幕用鼠标键盘完成的任务,Agent 也能做——而且不需要应用提供任何专用通道。

原文信息

  • 作者:Amit Shekhar,Outcome School 创始人,AI 与机器学习讲师
  • 原文发布日期:2026-08-14 原文地址:

文章评论(2

墨沐雨4 小时前

路过

回复
杨丽华3 小时前

收藏了,以后慢慢研究。

回复