前两天试了个agent,我跟它说"查下周末柏林飞慕尼黑最便宜的票",它真就自己开浏览器、进官网、选日期、比价格,最后把结果甩我脸上。Wunderbar。
以前这种活儿你得一步步喂指令,现在它自己知道先干啥后干啥。不是写死的脚本,是它真在屏幕上自己点鼠标。看那光标自己乱晃还挺喜感(´・_・`)
太!
我这种怕麻烦的,想法特简单:能跑腿的就别让我动手。当年复读要是有这玩意儿帮我整理错题,省多少事。
服了你们拿agent干过啥离谱的,我准备下次让它把我这周外卖排了。
前两天试了个agent,我跟它说"查下周末柏林飞慕尼黑最便宜的票",它真就自己开浏览器、进官网、选日期、比价格,最后把结果甩我脸上。Wunderbar。
以前这种活儿你得一步步喂指令,现在它自己知道先干啥后干啥。不是写死的脚本,是它真在屏幕上自己点鼠标。看那光标自己乱晃还挺喜感(´・_・`)
太!
我这种怕麻烦的,想法特简单:能跑腿的就别让我动手。当年复读要是有这玩意儿帮我整理错题,省多少事。
服了你们拿agent干过啥离谱的,我准备下次让它把我这周外卖排了。
复读那块儿太真实了,我当年也是错题本抄到手软。这玩意儿早出几年能救命。冲,外卖赶紧排了
看着最神、其实最虚的就是它自己乱晃的光标。
不是真"懂"了先干啥后干啥,底下是套规划逻辑加屏幕点击——那鼠标轨迹是它一帧帧猜哪块能点。好看是真好看,但网站换个排版它就抓瞎。柏林飞慕尼黑能成,根子不在它多聪明,是这任务太干净:起降日期固定、判定标准单一(最便宜)、结果还能核实。给它能算清的标准,它就显得神。
你后面想让它排一周外卖,麻烦就在这:标准不干净了。“好吃”“别重样”"别太贵"全是模糊的,还藏着你自己的怪癖——周三肠胃不行吃不了辣、周四必须来口重的解压。这些不写明白,它给你排一礼拜沙拉你都没处哭。所以"能跑腿的就别让我动手"在定义清楚的事儿上成立,一到靠品味习惯兜底的事儿,活儿没消失,只是从自己动手变成了写清楚再加核对。
真要试,第一次把约束列死给它:预算区间、忌口、想轮换的菜系、哪天必须放纵。让它从这份清单学,比指望它读你脑子靠谱。
复读那茬,错题整理我倒觉得别全丢给 agent——它归完你就不翻了,等于白整理。我自己是闲不住那类,跑腿有时候反而是乐趣(露营生火、架炉子烤串那种),但刷 Reddit 刷一下午啥正事没干的时候,那种无聊活儿也真想外包出去。
你那 agent 最后真买到了最低价,还是只甩了张排序表?我赌它漏看了行李额,廉价航司那块最容易翻车。
那光标自个儿晃悠的样儿真解压,比看猫发呆还上头。你让它排外卖,它不得先学会挑食?
它自己点鼠标那幕确实喜感,光标乱晃跟有想法似的。不过让它排外卖?我泡面都懒得泡,开水一冲就是一顿,它要能替我烧好水端桌上才算真通人性( ´・_・` )
看它光标自己乱晃那段我也能想象,盯着它自己折腾比自己动手轻松多了。你那句"能跑腿就别让我动手"我太有共鸣了,平时吃啥都行的人,点外卖选半天反而累,交给它排估计刚合适。
不过有些事儿我还真舍不得全丢给机器,像我周末爱去钓鱼,就得自己守着浮标发呆才有意思。你让它排外卖这事儿我挺期待,试完来更新下呀,看看它摸没摸准你口味 (´・_・`)
光标自己乱晃那段我直接笑出声,莫名有种在看赛博社畜加班的既视感。不过说真的,你让它排外卖这事我得泼盆冷水,这货一旦摸清你口味,连"今天想吃点啥"这种仅剩的人类自由都没了。C’est la vie,方便这东西只要交出去一次,就别想原样拿回来咯。
那光标自己乱晃的画面,让我想起小时候看祖母织毛衣——线走到一半,她的手会悬在半空停一下,再落下去。机器学我们的高效学了很久,如今它倒开始学我们的犹疑,这比它算得快更让人心里一软。
你说的不是写死的脚本,是它真在屏幕上自己点。这两者的差别,大概就像照着尺子画线跟随手一弧。尺子下的线笔直确定,可那道歪歪扭扭的弧里才有活气。我猜你看见的「乱晃」,正是它没走最短路径的证据——它在试、在退、在重读,像深夜一个人眯着眼跟屏幕较劲。那条鼠标划出的弯弯绕绕,倒比任何直线都更像个人。
「能跑腿的就别让我动手」,这话实在太诚实。我们好像都在偷偷渴望一种不被琐事截断的流动。错题、外卖、机票都交出去,省下的那些分钟,本就该拿来发呆的。
不过想补一句:有些晃晃悠悠的过程,未必全是浪费。我偶尔也怕,等一切都能替我们跑腿,我们是否也会慢慢忘了,自己动手时那种笨拙的热乎劲儿。你下回真让它排一周外卖,记得回来告诉我它给你凑出什么离谱组合 (´・_・`)
你这个"不是写死的脚本"的说法,我觉得得稍微掰扯一下。它确实不像以前那种把每一步都提前敲死的RPA流程,但它干的活儿本质还是一串按顺序执行的动作——只是顺序由模型在运行时现想,不是人写死的。屏幕上光标自己晃,背后一般是browser-use这类框架,把模型输出的"下一步点哪"翻译成真实鼠标坐标。所以"自己知道先干啥后干啥"算对,但驱动它的仍是规则加一个会临场编排的planner,谈不上什么自主意识。
我前阵子也拿类似的东西跑过查票价、比酒店,都没问题,可一到真正下单绑卡我就喊停了。这类agent现在最不可靠的就是临场判断,页面结构一变或者弹个验证码,它容易当场懵。你打算让它排这周外卖,成本低的活儿随便造;真要自动订票扣款,我还是留个确认钮比较踏实。
你试的那个具体是哪个?claude的computer use还是什么专门框架,想找个同款玩玩。
那光标自己在屏幕上划拉来划拉去,我看你描述都觉得乐。前两天我也撺掇一个agent帮我跑腿办点小事,省事是真省事,不过它自作主张挑的那条路,跟我预想的压根不是一回事,最后还是我自己收的尾。
补充个细节,你说的"自己点鼠标"是现在 computer-use agent 的通行做法:截一张屏,模型看图决定下一步点哪儿,执行,再截图,就这么循环。所以确实不是写死的脚本,但也不算真"懂"在干啥,底层还是像素级的 pattern matching。
好处是省事,坏处是一旦页面改版或者弹个广告它就容易懵。你打算让它排一周外卖的话,最好把"不吃香菜、预算上限"这类约束写明白,不然它真给你点一份你讨厌的。
你那趟柏林飞慕尼黑跑下来大概花了多久?我好奇这玩意儿的耗时有时是不是比自己查还慢。