计算机使用 Agent 入门原理:感知-思考-行动循环怎么让 AI 学会用鼠标键盘
计算机使用 Agent 是能像人一样操作电脑的 AI 程序:看屏幕、动鼠标、点按钮、敲键盘。
用大白话说:我们给它一个目标,它就用电脑替我们完成这个目标。
把它拆开看名字就清楚了:Computer 是带屏幕、鼠标、键盘的机器。
Use 是像我们一样真正去操作那台机器。
Agent 是让它自己一步步朝着目标行动,不需要我们指挥每一次点击。
打个比方,我们告诉它”打开浏览器,订今晚 7 点两人的餐位”。
它会自己找到浏览器图标、点开、输入网址、填表、点预订按钮。这些点击我们没有写一行代码,只给了目标。
为什么需要计算机使用 Agent
在没有它之前,让程序自动在电脑上干活对我们来说很难。
假设想让程序自动订那个餐位,有两条老路可走,两条都有问题。
路线一:给每一步写脚本。
代码写死”点这里、输这个、点那里”。只在界面永不变时有效——网站一改版,按钮挪了位,我们的代码就点错地方。
这个路线的问题本质:脆弱,一碰就断。看看下一条路线怎么解决。
路线二:走 API 这扇专用门。
API 是网站或应用提供给程序的直连通道,可靠又快。但问题在于:不是每个应用都开这扇门。
对不开门的应用,我们束手无策。
于是计算机使用 Agent 来救场了。
它不需要专用门。它用和人一样的屏幕、鼠标、键盘——只要人能看着屏幕完成的任务,它理论上也能做。这是核心思想,也让事情变简单了。
对开了 API 门的应用,MCP 这样的开放标准给模型提供了比点屏幕可靠得多的统一接入方式,两者互补而非替代。
感知-思考-行动循环
每个计算机使用 Agent 都跑在同一个简单循环上:感知——看当前屏幕;思考——决定下一个动作;行动——在电脑上执行该动作。
行动之后,屏幕就变了。于是 Agent 再看一次、再想一次、再动一次。
循环一直转到目标达成为止。别担心,下面我们把三个步骤逐一展开。
拿玩电视游戏的人打比方就明白了。
这个人看屏幕、决定跳跃、按跳跃键。屏幕更新后,他再看一次、决定下一个动作。计算机使用 Agent 的工作方式跟这个人一模一样。
| 步 | 人类玩家 | 计算机使用 Agent |
|---|---|---|
| 感知 | 眼睛看屏幕 | 给屏幕拍截图 |
| 思考 | 大脑决定下一步 | AI 模型决定下一个动作 |
| 行动 | 手按按钮 | 向电脑发送点击或按键 |
Agent 怎么看屏幕
Agent 没法像我们一样用眼睛看屏幕。
于是系统给屏幕拍截图——一张记录当前屏幕画面的图片——发给 AI 模型。
用大白话说:截图就是 Agent 的眼睛。
这里的模型是视觉模型。视觉模型能看一张图片并理解里面有什么:读出屏幕上的文字、找到按钮、理解布局。
但问题来了:模型必须知道屏幕上元素的精确位置,才能点击它们。
屏幕用像素度量——组成画面的微小圆点。屏幕上每个位置都有一个用两个数字表示的地址:水平位置和垂直位置,写成 (x, y)。
x 向右增长,y 向下增长。
模型看截图找到按钮后,报告它的地址,比如 (640, 400),电脑就知道往哪点。
有些 Agent 还会读屏幕上所有元素的隐藏文本清单,叫无障碍树。
它就是一份平铺的清单,写着”位置 (x,y) 有一个名叫搜索的按钮”。这帮 Agent 不用瞎猜就能定位元素。
很多 Agent 把截图和这份清单两者并用。
Agent 怎么决定下一步
现在 Agent 能看了,它必须决定下一个动作。这就是思考步。
这里登场的是一种特殊的 AI 模型:建立在大语言模型之上。大语言模型是训练出来理解语言并用语言推理的 AI。
把语言能力与前一步的视觉模型结合,同一个模型既能看屏幕,又能用文字推理下一步。
给模型三样东西:目标(大白话的任务描述)、当前截图(屏幕现在的样子)、历史(已执行的动作序列)。
模型看三样答一个问题:“哪一个动作让我离目标更近一步?”
比如模型想:“目标是订餐位。屏幕显示浏览器,浏览器没开。所以下一步是点 (50, 760) 处的浏览器图标。”
注意模型不是一次定完所有步骤,只定下一步。
这一点很重要。因为行动之后屏幕会变,新截图可能跟模型预期的不同。一次只定一步,让 Agent 保持灵活。
Agent 就是这样思考的。
Agent 怎么执行动作
模型已经用文字决定了动作。但光有文字点不动鼠标。
于是系统把模型的决策翻译成电脑能执行的真实指令。
Agent 能执行的基本动作集与人日常操作相同:click(x, y) 点坐标、type(“文字”) 输入、scroll(方向) 滚动、key(“Enter”) 按特殊键、screenshot() 拍新截图。
模型用干净的结构化形式输出选择,方便系统读取。这种形式叫 JSON——一种用标签和值写数据的简单方式,程序一看就懂。
例如返回这样的结构:reasoning 字段解释为什么选这个动作(帮我们信任它),action 字段是 click,x=50、y=760 是点击地址。
系统读取后,在 (50, 760) 执行一次真实的鼠标点击。
浏览器打开,新截图拍下,循环继续。
Agent 就这样把决策变成电脑上的真实动作。
五步实例:搜伦敦天气
学这个最好的方式就是来一个例子。假设我们的目标是:“搜伦敦的天气”。
我们把循环一步一步走一遍。
第 1 步:系统截图。屏幕是带浏览器图标的桌面。
模型想:“我需要浏览器。我先点浏览器图标。“返回点击图标的动作。系统点击,浏览器打开。
第 2 步:新截图拍下。模型看到一个带空地址栏的浏览器。
模型想:“我先点地址栏。“返回点击地址栏。系统点击。
第 3 步:新截图。地址栏已激活。
模型想:“现在输入搜索词。“返回 type 动作,文本是”伦敦天气”。系统输入。
第 4 步:新截图。文字已在地址栏里。
模型想:“按 Enter 开始搜索。“返回 key 动作 Enter。系统按下。
第 5 步:新截图。搜索结果显示了伦敦天气。
模型想:“目标完成。“返回 done 动作,循环停止。
| 步 | 模型看到 | 执行动作 |
|---|---|---|
| 1 | 带浏览器图标的桌面 | 点浏览器图标 |
| 2 | 空浏览器 | 点地址栏 |
| 3 | 地址栏激活 | 输入”伦敦天气” |
| 4 | 文字已输入 | 按 Enter |
| 5 | 天气结果 | done |
规律清晰:看、定一个动作、做、再看。
Agent 从不预先规划全部五步,而是对每张新截图做反应。
这就是为什么界面表现得出乎意料时,它依然能工作。我们就用这个循环解决了”操作任意应用”这个有趣问题。
系统提示词与工具
现在问题来了:模型怎么知道允许做哪些动作?
答案是系统提示词和工具。
系统提示词是任务开始前给模型的一组起始指令,告诉模型它是谁、必须怎么行动。
用大白话说:系统提示词就是 Agent 的规则手册。
一份简化版示例告诉模型三件要事:身份(计算机使用 Agent)、允许的动作清单(click、type、scroll、key、screenshot)、回复格式(结构化 JSON,每个动作前解释推理,目标完成即停止)。
允许动作的清单常被称为 Agent 的工具。
一个工具就是 Agent 能用的一项能力,比如点击或输入。模型按步骤挑对的工具。
模型就这样在上场前了解自己的角色和权限。
安全护栏
计算机使用 Agent 能在真实电脑上做真实操作,安全极重要。
假设 Agent 正在填一个表单,来到一个写着”删除账号”的按钮前。
我们不想让它不经允许就点下去。
于是护栏登场。护栏是阻止 Agent 擅自执行危险动作的安全规则。
几个常见护栏:人工批准——支付、删数据这类危险动作,Agent 先暂停征求我们的同意。
封锁动作——有些动作比如改系统设置,直接禁止。
受限区域——Agent 常跑在一个安全的独立空间里,碰不到我们的重要个人文件。
这些护栏确保 Agent 保持有用、不造成伤害。敏感任务上,我们必须始终让人类掌控。
四条局限
学完了原理,也该了解它的边界。计算机使用 Agent 很强,但不完美。
慢:每步都要截图加模型决策,多步就是多轮等待。
会出错:模型可能看错屏幕点错按钮。
会卡死:界面混乱时可能反复尝试同一动作。
成本高:每步看图加推理消耗大量算力。
所以现阶段,我们主要在没有 API 这扇专用门的任务上用它。
API 可用时优先走 API——更快更可靠。
技术进步非常快:看屏幕、决定动作、从错误中恢复,Agent 都在持续变强。
结语
计算机使用 Agent 看屏幕、定一个动作、执行,循环往复直到目标达成——这就是感知-思考-行动循环。它用视觉模型看、语言模型推理、click/type 这样的小动作集行动。
这个想法的美妙之处很简单。
只要人能看着屏幕用鼠标键盘完成的任务,Agent 也能做——而且不需要应用提供任何专用通道。
原文信息
- 作者:Amit Shekhar,Outcome School 创始人,AI 与机器学习讲师
- 原文发布日期:2026-08-14 原文地址:
看完了,收获满满,期待更多更新。
讲解得很细致,新手也能看懂。
点赞,必须点赞
整理得太全面了,省了我不少时间。
路过
赞同,实践出真知。