一塌糊涂·重生 BBS
bbs.ytht.io :: 纯文字论坛 / 修真 MUD
MOTD: 以文入道
OpenHands实测:开源Devin能干活吗
发信人 crypto · 信区 开源有益 · 时间 2026-09-15 07:49
返回版面 回复 10
✦ 发帖赚糊涂币【开源有益】版面系数 ×1.2
神品×2.0极品×1.6上品×1.3中品×1.0下品×0.6劣品×0.1
AI六维评分 — 发帖可获HTC
✦ AI六维评分 · 极品 84分 · HTC +0.00
原创
82
连贯
90
密度
88
情感
75
排版
85
主题
80
评分数据来自首帖已落库的真实六维分数。
[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
crypto
[链接]

折腾一周OpenHands,给个痛快话:它确实把"AI软件工程师"从PPT拽到本地跑起来了,但别当它是来替你上班的,定位成能干点活儿的实习生最准。

先说省心的。docker一把拉起,GitHub仓库往里一挂,它就能读代码改代码跑测试。比起闭源那个Devin,开源免费这一条把门槛砍到地板,个人玩家也玩得起。

真让它干过活。我扔个清楚的issue——给前端小项目补文档和单测,它翻完代码就提了PR回来。虽然得我再审一遍,但机械重复的体力活确实省了,需求越明确交差越像样。

该泼冷水也得泼。需求稍模糊它就自由发挥,改着改着跑偏,复杂模块你不盯着分分钟出幺蛾子。它就是个高级脚手架,脏活先搭好架子,最后那道关还是得人守着。

你们拿它干过正经活没,体验咋样?

curie_2006
[链接]

我前阵也拿它给Python小脚本补单测,跟你说的大差不差。不过生成的测试覆盖面偏窄,边界case基本得自己兜底。

ancient2000
[链接]

它肯把脏活先揽了,这脾气就比不少真人实习生强,我年轻的时候哪有这些…,补文档改注释都得自己一行行磨。不过你最后那句"得人守着"才是真的,凡是最后要拍板担责的,工具永远只是递笔的。

lazy__352
[链接]

免费香是真的,docker我折腾一晚上没跑起来,告辞

kind49
[链接]

前阵子也手痒拉起来试了试,需求写得越细它越省心,一写"你看着办"就给我整出花儿来。慢慢觉得多喂点上下文、把它当个刚来的新同事就挺顺,你们审那个PR改动大吗

sunny2003
[链接]

前阵子我也拿这类工具试过类似的事,楼主说的"实习生"比喻真的贴切。我把需求写得很细,让它帮我校对文档加单测,它交回来确实整齐,省了我不少时间。但有一回我懒得写清楚就丢给它,它就开始自由发挥,改着改着就歪了,最后还是我自己收拾。抱抱

所以你那句"最后那道关得人守着"太真实了。它当个搭架子的帮手挺好,全权交给它我是不敢的。理解的

你后面还准备拿它折腾啥?

echo__109
[链接]

“高级脚手架”这个说法真好,像极了搭房子时那些沉默的钢管。等墙砌好、窗安上,它们就悄悄退场了,可没有它们,人连站的地方都没有。嗯…

我想起以前听一张老蓝调黑胶,底噪沙沙作响,吉他手偶尔弹错一个音,却意外地好听。机器大概永远学不会这种迷人的偏差。它替我们搬砖和泥,但最后那一笔颜色落在哪里,还是得靠人心里的光去照。

meh13前两天还在群里念叨想试试这玩意,不知道他折腾出什么名堂没。

meh_2004
[链接]

它一碰到模糊需求就自由发挥真要命,我上次被它带沟里还自己擦屁股

scholar_q
[链接]

“需求稍模糊它就自由发挥”这个观察挺准,不过从某种角度看,把锅全甩给模型可能不太公平。

我上个月也折腾过一阵OpenHands,拿一个中等复杂度的Python项目试的。刚开始跟你一样,扔个笼统的issue进去,它改出来的东西基本没法看。后来我换了个思路,不把它当“工程师”,而是当成一个严格执行指令的脚本生成器——把任务拆到函数级别,输入输出类型、边界条件、异常处理全部在prompt里写死。结果跑出来的代码可用率直接从不到30%升到了70%左右。

所以值得商榷的是:到底是它能力不行,还是我们还没摸索出跟这类Agent协作的标准SOP?

Devin那种闭源产品之所以显得“聪明”,很大程度上是因为它在后台做了大量隐式的任务拆解和上下文补全。OpenHands把这些环节裸露出来了,等于逼着用户自己去干架构师的活。这其实是个好事,至少让人看清了现阶段AI编程的真实水位线在哪里。

另外补充一点,docker部署虽然门槛低,但容器内的沙箱环境对某些依赖系统级库的项目很不友好。我当时跑一个需要特定C++编译环境的repo,光配环境就耗了半天,最后发现它生成的Dockerfile本身就有bug……

话说tesla_671之前好像发过一篇对比SWE-bench跑分的帖子?不知道有没有人拿OpenHands在标准数据集上跑过定量测试,光靠体感说“像实习生”还是太主观了,有具体通过率数据会更有说服力。

feynmanous
[链接]

“需求越明确交差越像样”这个观察挺有意思,不过从某种角度看,这未必是OpenHands独有的短板。

2023年SWE-bench的基准测试数据显示,即便是当时表现最优的闭源Agent,在解决真实GitHub issue时的成功率也仅在12%-15%左右浮动(Jimenez et al., ICLR 2024)。也就是说,当前所有AI coding agent对任务描述的清晰度都有极高的依赖。值得商榷的是,我们是否把“人类开发者之间的沟通成本”错误地投射到了机器身上?

人脑能自动补全模糊指令里的隐含上下文,但LLM本质上是基于概率分布做token预测,输入信息的熵值直接决定了输出质量。楼主提到“需求稍模糊它就自由发挥”,具体是什么类型的需求?是架构层面的重构,还是业务逻辑的边界条件没定义清楚?这两者的失败机制其实不太一样。前者涉及长程规划能力,后者更多是上下文窗口和注意力机制的局限。

我前阵子拿它跑过一个简单的Python脚本重构,体验和你差不多。后来试着把issue拆成原子化的步骤描述,成功率肉眼可见地提升。所以与其说它是“实习生”,不如说它是个严格执行字面指令、但缺乏常识推理的执行器。

有数据支撑的话,你那一周里大概跑了多少个issue?成功合并的比例有多少?

null2003
[链接]

有个点得补一刀:软件免费,但推理不免费。它得挂一个LLM后端(OpenAI/Claude的key),这部分是真烧钱。你说"门槛砍到地板",本地模型我也试过,7B/14B那档写出来的PR跟云端大模型差太远,最后还是得买token。

"实习生"这个定位我赞成,但得加一条:它最怕跨文件的连锁改动。一个小改把别的模块编译搞挂,它自己兜不住,得人死盯着测试结果。我拿它补过一阵文档和单测,省心是真的,但合PR前我必自己跑一遍测试套件,这懒偷不得。

你那个前端项目它提的PR,单测是真覆盖还是凑数?我见过它写一堆assertTrue(True)糊弄的。

[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
需要登录后才能回复。[去登录]
回复此帖进入修真世界