做 Agent 半年,我总结了 24 个关键词:帮你快速听懂 Agent 领域在聊什么。
从3月份开始做Agent产品,到现在已经差不多半年,从刚开始的一无所知到现在的一知半解,对Agent的理解也越来越具体。
刚开始我以为Agent就是LLM加上一些提示词和工具,但是真正做下来发现,其实这只是其中一部分,工具调用,上下文管理,记忆系统,Agent评测这些都是必须要处理的问题。
学习一个行业最快捷的方式就是了解这个行业的关键词,Agent领域也是。
所以在这里,我把这半年做Agent产品遇到的行业关键词,以及我对他们的理解都分享一下,既是对自己半年学习的总结,也希望对相关朋友有所帮助。
当然,内容纯个人手搓,主要来自实际做产品的理解,有些表述未必那么准确,大概意思到了就行。
1、LLM:大语言模型
他的核心能力就是根据已经有的上下文来推测下一个内容,从叫法也可以看出,他最原始的形态就是纯粹的文字,根据文字预测文字。
不过经过这两年的发展,很多大语言模型不仅仅支持文字,图片、视频、音频等都慢慢支持,但是也保留了叫法,没有很严格的划分。
生图模型,语音模型,视频模型,还有很多划分吧,这个就不赘述了。
2、多模态:模型支持多种类型的信息
模型不仅仅支持文字,还支持图片、视频等,我们就称其为多模态模型,支持多种类型的信息。
从输入和输出的角度来看,多模态有两种,输入多模态,输出多模态,顾名思义,这里就不多解释。
从训练的角度来讲,多模态又分为原生多模态和非原生多模态,这个简单解释一下,原生多模态就是模型直接理解信息本身。
比如一段人说的话,原生多模态直接理解这段音频,处理说话的内容,可能他还能知道说话的语气,音量;
而非原生多模态可能是,内部有个语音转文字的模型,然后文字再给大语言模型。
外面的人看来,输入的都是一段音频,没啥区别,但是内部系统来看,原生多模态有明显的优势,他直接理解信息本身,通常能保留更多的信息。
而非原生多模态的优势则在于他每一个模块可以单独替换,针对特定场景,每一部分选择特定的模型,达到需要的效果。
原生多模态和非原生多模态没有优劣之分,更多的时候是看场景,综合速度、价格、能力等选择合适的模型。
3、流式输出/非流式输出
分别表示生成了啥内容就马上发出啥内容以及内容全部输出完才发出来。
比如一个语音转文字的模型,流式输出的是他一直在听你说话,你边说他就边转文字,而非流失输出的则是等你说完了,他才把你的整段音频转换成文字。
4、Agent
似乎Agent都是和LLM放在一起理解,LLM只能说,但是不能干活,而Agent则是能够真的干活。
举个例子:你问21年到25年黄金价格变化,LLL的回答是基于他的内部数据知识,直接给你;
而Agent则是会调用相关的工具,去真实的网页,或者啥地方查,更聪明的Agent可能会多个渠道对比,不同地方的价格都给你。
5、Function Calling
LLM表达自己想要使用工具这个过程就叫做Function Calling,模型输出了一段结构化的内容,外部程序收到了就真的干活。
6、Tool Use
Tool Use则是让模型的这个意图编程真实的行动,LLM表达了模型的工具调用的意图,Agent系统负责让工具真的用起来。
这样我们就理解了为啥说LLM是大脑,Agent才是真的能干活的员工。
7、ReAct:Reasoning + Acting
Tool Use 决定了模型能不能用外部工具完成任务,而ReAct则表示模型如何一步一的做出决策,使用合适的工具,完成任务的这个过程。
ReAct:故名思义,思考,决策,行动,拿到结果,分析结果,继续思考,决策,行动……
根据结果来优化步骤,进行下一步的操作,这种相较于纯粹的思考、思考、思考,给你结果,中间多了纠错的可能。
但是它不一定完全可靠,有时候也会出错,所以通常会有限制,某些工具的权限、超时机制、重试次数、最大行动次数。
8、可打断性:Interruptibility
最近使用Agent,做Agent产品,发现似乎能不能打断,中途用户能不能插话,非常影响用户体验。
很多时候,用户是没有能力把事情一次性想清楚的,可能内容发出去了又想到一部分,
或者是看到Agent开始干活,有了想法需要插话,亦或是发现Agent已经做错了,让他别做了,这些都是需要插话的场景。
现在我看似乎Codex和Claude code都做的还行,中间插话他们叫做“引导”,最近比较火的Workbuddy和豆包工作似乎不支持。
9:MCP:Model Context Protocol,模型上下文协议
MCP解决了AI产品怎么和外部服务,上下文,能力等的的连接。
在这之前,每个AI应用都要对每一个外部应用都要单独开发一种接入方式,而有了MCP,外部应用直接给一个统一的接口,AI应用按照这个接口就能接入对应的能力了。
比如淘宝MCP,他有自己统一的接口和请求方式,Agent产品就能通过这个标准接口调用淘宝相关工具和能力。
有MCP的外部服务,你不需要自己再写工具,MCP的接口告诉你它提供哪些工具,如何发起调用,接受结果,你直接用人家的就得了。
但是假如人家的MCP没有提供某些工具,某些数据,你又想要?这时候就需要你自己写工具,想办法获取了。
10、Skill
不严格的来讲,Skill就是一段提示词,告诉你这个任务12345分别做什么,怎么用工具,
这针对只有一个孤零零的Skill.md文件的skill是成立的,但是很多Skill 还有自己特有的工具。
大多数时候skill针对某一类反复出现重复的场景,用skill把相关流程写清楚,启动条件,操作说明等固定下来,能够极大的节省人力。
11、workflow:工作流
Agent是能自主决定,自主干活的系统,而skill则是经验沉淀,Agent看见之后,他知道这样干活可能更好,但是可能Agent也会自己找到更好的路,不一定就按照skill的来,自主性高。
而workflow则是描述一个相对固定的流程,这一步输入是什么,啥格式内容,输出是什么,失败了怎么处理,workflow的大部分情况都考虑到了,自主性较差。
Agent和workflow也不是非此即彼,大多数时候是混合使用,以便达到更好的效果。
12、Agent Runtime
Agent持续运行需要的基础设施,让Agent这个系统能够正常稳定的运行,管理模型调用工,使用工具,还有各种状态处理的系统。
13、HITL:Humon in the loop,人在回路
真是奇怪的翻译,HITL,就人工介入,Agent干活不能无脑干到黑,有的东西需要你介入确认,有的事必须你来做才行。
14、Sandbox:沙箱
Agent的一个受限制的运行环境,你在这个范围内干活,即使出事了,也尽量降低对用户的影响。
15、Artifact
Agent给你交付的东西,说起这个,Claude桌面App最近挺烦的,每次让他生成demo文件,他都要调用一个artifact相关的skill,然后生成一个claude.ai/aritifac/^的链接,烦,我只要本地的,每次都得提醒。
16、Memory:记忆
模型是没有记忆的,你的每一次看见的输出都是全新的结果,所谓记忆,其实是过往运行的一些保留在模型外面的内容。
每次模型的输入除了你给他的,还有系统里保留的一堆东西,经过处理后输入给模型,输入足够丰富全面,所以输出就成了懂你的样子。
17、Context Window:上下文窗口
模型一次能处理的上下文长度,现在比较常见的似乎是百万上下文。
18、上下文压缩
模型上下文是有限的,一次输入的输出总内容是有限的,当你单轮交流太长,模型就记不住你之前说过啥了。
上下文压缩就是根据需要,删除一些内容,留下更有用的内容,保证当前任务不断线,让Agent能继续工作。上下文压缩的方法很多,不同的Agent系统不一样,感兴趣的可以自行研究。
19、Prompt Engineering:提示词工程
在很久之前还有提示词工程师的说法,现在已经听不到了,但是提示词工程还是存在的,虽然模型很强大,但是依旧需要研究,怎么写,模型才能更容易理解。
20、Context Engineering:上下文工程
每次调用模型的时候,能够让模型更好地完成任务所需要的信息,包括但不限于记忆、工具描述、权限信息、用户需求……
21:Sub-Agent
个人感觉其实未来一个就够了,为啥还要分成多个呢?现在的sub-agent也许只权益之计,上下文窗口不够,模型能力不行等各种原因所导致。
目前sub-agent的设计核心就是清晰的边界,某个Agent处理某一类任务,然后这类任务有一些通用的工具,这个Agent的权限划分好。
22、evals:评测
Agent的一个重要的特点就是工作过程不确定,输出结果也不是确定的,这个时候,产品研发中做好评测就很重要了。
评测一般来看两部分,首先就是结果,标准任务看有没有完成,非标准任务看结果的质量;其次看的就是完成任务的过程,调用工具,步数,时间,模型开销,等等。
比如一个淘宝购物的Agent,它自己有一些工具,每一步可能的前进方式,评测就基于这些来考量。
有没有调用相关工具打开对应的网页,点击/滚动方式对不对,几次才成功,失败了怎么处理,付款页面怎么解决,敏感操作怎么处理。
然后分析整个过程,该优化工具的优化工具,优化提示词的优化提示词,评测驱动开发,然后继续评测,不断提升Agent的效果。
23:benchmark
不知道怎么翻译,大概就是统一测试,大家同台竞技,用同一套标准来评测,你得分高,你牛逼,你第一。
24、Computer Use
这个最近Codex的Computer Use比较火,我觉得这个方向潜力蛮大的,因为可能很长一段时间,很多app都没有接口,那Computer Use,视觉理解的方式就是Agent控制App的重要方式了。
对应的还有phone use和brower ues,个人觉得这三个能力是重点方向,因为大多数互联网底层还是太封闭了,视觉是重要的通用路径,可以覆盖很多没有接口的场景。
OK,差不多就这些内容,上面这些词肯定不是Agent领域的全部,可能很多理解也不完全准确,但是通过这些词,你基本能看出一个Agent产品是怎么从模型变成一个真正能干活的系统的。
当然,AI领域也在快速发展,有些现在看起来很时髦的东西,半年后就未必还重要了。
我对Agent的理解也在不断变化,就行做,继续踩坑,后面也会继续分享更多AI相关的知识,欢迎关注我,一起进步成长。
原文信息
作者:王赞(@wangzan101)
原文地址:
内容翔实,正好需要,先收藏再看。
写得挺用心的,支持一下。
实测过类似工具,作者说的基本属实。