Hello哇!各位朋友,我又来给大家安利好用的AI skill啦!
相信大家在日常工作里,经常要用浏览器搜个信息、下个文件。但这些事都得自己动手点,打开网页、找到对应的地方、点按钮、再下载。一次两次还好,天天这么点,是真麻烦。
今天给大家推荐一个skill,叫"agent-browser",这个也是在GitHub上很火的一个skill,当然不是我做的,我主要是给大家安利一下哦。
装进WorkBuddy之后,你需要浏览器自动干活的时候,直接在WorkBuddy里下指令,它就去操控浏览器了。
(效果演示视频:搜索下载PPT的全过程)
在视频当中,我只是下达了指令和点击了允许,其他的操作全都是work buddy和这个skill操作的,我是一点没动哦~
最重要的是,这个消耗的积分也不多,我视频当中的这个操作整体下来,只消耗了约15个积分,消耗不大的!
有人会问:WorkBuddy自己不是能搜吗?
问得好。这就说到点子上了。
WorkBuddy自带的搜索工具叫webfetch,它的作用是抓取网页内容、帮你归纳总结。也就是说,它能把一个网页"读"给你听。
但问题是,它只能读,不能动。如果网页需要你点一下"下一页"、勾一个复选框、填个表单才能继续,webfetch就卡住了——它不会点按钮,没法实现真正的自动化。
这个skill就不一样。你下完指令,它自己打开浏览器、找到网站、点点点、填填填、下载,全程你不用盯着。中间偶尔会需要你点一下"授权",让它进行下一步,点完你就该干嘛干嘛去。
这个skill能在浏览器里干什么?
它的能力比你想的多:
浏览与导航——打开网页、前进后退、多标签页管理,甚至iframe里的操作都能处理。
看懂页面——它能生成一个"无障碍树",把页面上所有能点、能填、能选的东西列成一张清单交给AI。有了这张清单,AI就像拿到了说明书,清楚知道"这个页面有哪些按钮、哪些输入框、哪些链接"。
页面交互——点击、填表、下拉选择、勾选复选框、拖拽、滚轮、按键、文件上传、鼠标悬停……你手动能在浏览器里做的操作,它基本都能做。
信息提取——交互的过程中随时提取页面上任何信息。
智能阅读——这个功能是专门为AI设计的。它会自动请求网页的markdown版本,提取正文、生成大纲,把广告和导航栏的噪音全部过滤掉,只留你要的干货。
截图与PDF——页面截图(支持全页截图和带标注的截图),还能保存成PDF。
写在最后
我现在在WorkBuddy里装了不少skill,轻量版的、重量版的都有,都跑得挺顺。WorkBuddy的兼容性和承载能力,我个人是挺满意的。
如果你也想让浏览器的事交给AI去办,同时安装之后不知道怎样使用,请关注并私信我——"浏览器",我把这个skill和使用方法分享给你。
Q&A
Q1:装了之后需要自己配环境吗?
A:不需要。告诉WorkBuddy你要用这个skill,让它把需要的环境装好就行,不用你自己动手。不过浏览器的话,尽量使用谷歌或者edge浏览器。
Q2:它和WorkBuddy自带的搜索工具有什么区别?
A:自带的webfetch只能"读"网页、抓取内容做总结;agent-browser能"操作"网页——点击、填表、下载都能做。需要交互的自动化场景,得用agent-browser。
Q3:能用来操控某东、某宝这类需要验证的网站吗?
A:不建议。虽然你和WorkBuddy可以协作完成验证,但整个过程速度比较慢,效率不高。这类需要频繁验证的网站,还是自己手动操作更划算。这个skill更适合那些不需要登录验证、流程相对固定的网站。
关于作者
小刘(刘李海),AI 实践者,智能体应用师(中级)、ACA大模型工程师持证。非技术背景,用文科生视角探索 AI 在工作中的落地方法。专注于 AI赋能个人与组织、AI 工具实操、Skill创建、智能体搭建、AI 内容创作、知识库搭建等。已培训八百多人,目前也正在持续探索AI更多的方向。如果你也想系统学 AI,并真正用进工作和生活,欢迎评论或私信交流;我会结合你的实际情况、工作场景和当前基础,帮你梳理更适合你的学习路径,让你更快从"知道"走到"会用"。
公众号:[AI数字航海家] 头条号:[AI数字航海家]
--end--
谢谢你读到这里。
既然都看到这了,如果觉得文章还不错,就随手点个赞、留个关注吧。如果不关注也没关系,那就把这份相遇交给时间——希望有一天,我的某一篇文章,能真正打动你。
我们下次见。
推荐站内搜索:最好用的开发软件、免费开源系统、渗透测试工具云盘下载、最新渗透测试资料、最新黑客工具下载……




还没有评论,来说两句吧...