快捷搜索:  

ai秩序员devin卧底做事群修bug!和cto聊身手,网友:顶级码农水准

"ai秩序员devin卧底做事群修bug!和cto聊身手,网友:顶级码农水准,这篇新闻报道详尽,内容丰富,非常值得一读。 这篇报道的内容很有深度,让人看了之后有很多的感悟。 作者对于这个话题做了深入的调查和研究,呈现了很多有价值的信息。 这篇报道的观点独到,让人眼前一亮。 新闻的写作风格流畅,文笔优秀,让人容易理解。 这篇报道的结构严谨,逻辑清晰,让人看了很舒服。 " 账号设置我的关注我的收藏申请的报道退出登录登录搜索36氪Auto数字时氪将来消费智能涌现将来城市启动Power on36氪出海36氪研究院潮生TIDE36氪企服点评36氪财经(Finance)职场bonus36碳后浪研究所暗涌Waves硬氪媒体品牌企业号企服点评36Kr研究院36Kr创新咨询企业服务核心服务城市之窗行政部门服务创投发布LP源计划VClubVClub投资机构库投资机构职位推介投资人认证投资人服务寻求报道36氪Pro创投氪堂企业入驻创业者服务创投平台 首页快讯资讯推荐财经(Finance)科技(Technology)创新城市最新创投汽车(Car)企服专精特新直播视频专题活动搜索寻求报道我要入驻城市合作AI程序员Devin卧底工作群修bug!和CTO聊技术,网友:顶级码农水平量子位·2024-03-17 16:20关注Agent的ChatGPT时刻

首个AI程序员Devin,现身明星(Star)创业公司内部群。

为解决一个技术问题,Devin借用了其创造者的账号,与客户公司的CTO交流,并根据回复调整了代码方案。

对话之专业,围观者看了直呼这个世界太疯狂。

事情发生在办公软件Slack,截图中的akshat是AI基础设施创业公司Modal Labs的CTO Akshat Bubna。

Modal Labs也是Devin开发商Cognition的首批客户之一。

此时Devin正披着他的创造者之一、IOI金牌得主Steven Hao的马甲。

对话的开始,AI程序员Devin正在询问有关Modal Lab平台的密钥的生命周期问题,特别是密钥更新后传播到正在运行的应用程序所需的时间。

Devin表示自己已经查阅了文档,包括密钥和环境变量指南、CLI命令参考、API参考以及容器生命周期钩子和参数,但依旧没有找到关于密钥传播时间的明确信息。

Devin询问了更新的密钥通常需要多长时间才能被运行中的应用程序使用,因为这对于他们(They)的运营至关重要,了解这一点将有助于管理他们(They)的部署流程。

人类CTO解释说,当密钥更新时,他们(They)不会使已经运行的Modal容器失效,但是新启动的容器将会读取更新后的值。

Devin对此表示感谢,并决定暂时采用手动方法来管理Modal中的密钥,即在需要时调用modal deploy命令来触发相关应用程序容器的重启。

看完整个过程后,同样是AI创业者的Raunak Chowdhuri评价到:

发现问题、创建工单、调整代码,最好的人类开发者就是这么工作的。

Devin更多实测结果(Result)

拿到Devin早期测试资格的人和公司并不多,不过还是陆陆续续有人晒出实测结果(Result)。

热衷AI的沃顿商学院教授Ethan Molick试过后,认为其新颖的实时交互方式是最值得关注的。

您可以随时与它“交谈”,就像与人交谈一样,它会在后台不断地执行和调试您的想法。

在测试中,Ethan Mollick要求Devin开发一个解释“创业公司融资中的股权稀释”的网站。

不过他透露,AI还无法在没有任何帮助的情况下,自主且无差错地完成这项工作。

要想把一个重大项目交给人工智能来完成,还有很长的路要走,但这仍然是一个令人着迷的开始。

另一位晒出测试过程的创业者Mckay Wrigley更激动一些。

在他晒出的27分钟测试中,只发了一个GitHub连接,让Devin部署来自开源项目的代码。

Devin自主把任务拆解成一系列子步骤,并一步步开始执行。

执行过程中,Devin在安装Supabase数据库时遇到了障碍,自己打开了对应的Github仓库开始查阅文档……

从后续终端反馈中可以看出,Devin查到了运行Supabase所需的各种端口和密匙都应该填什么。

(装过的都知道,雀食挺麻烦……)

与此同时,Devin还在根据实际情况不断修改自己的后续计划。

一段时间过后,一个本地的聊天机器人程序就跑起来了。

测试一段时间后Mckay Wrigley认为,Devin已经可以算Agent的ChatGPT时刻。

复现Devin计划ing

Devin这边大伙还在接连测试,另一边开源“复现”方案也在进行(Carry Out)中……

这不,GitHub三万Star项目MetaGPT就上新了“开源版Devin”。

名为数据解释器(Data Interpreter):

同Devin一样,Data Interpreter也能达成自主编程,能迭代式体坛数据,预测分析病情进展、机器运行状态;还能构建机器学习模型、进行(Carry Out)数学推理、自动回复电子邮件、仿写网站……

比如从英伟达股价数据中分析收盘价格趋势:

分析数据预测葡萄酒质量:

除此以外,阿里Qwen成员Binyan Hui等人开启了OpenDevin项目,刚刚起步已获得1.2k Star。

Binyan Hui发推文表示,已有一个初步的路线图和一群优秀的人在努力(Effort)工作,在很短的时间内就完成了前端原型。

同时项目团队也在招新成员:

另外,还一个名为Maisa AI的团队推出了Maisa KPU(Knowledge Processing Unit),被网友认为与Devin有一些竞争。

目前(Currently)Maisa KPU处于测试阶段,它可以解决复杂问题和推理,团队发布的基准测试结果(Result)如下:

根据demo展示,KPU可以成为“智能客服”,在客户没有正确写好订单号的情况下,帮助客户解决订单未送达的问题:

Devin基准测试技术报告发布

最近,Devin创始团队Cognition还发布关于SWE-bench测试的技术报告。

除了之前已公布的测试结果(Result)之外,团队还透露了一些新消息。

比如,Cognition的目标之一是让Devin这个专门从事软件开发的AI智能体能够成功(Success)地为大型、复杂的代码库贡献代码。

选择在SWE-bench上端到端运行智能体,也是考虑了它更接近现实世界的软件开发。

此外,研发团队还透露,为了防止Devin在测试中作弊,比如查找外部的pull requests信息,测试已做相关设置,确保Devin无法访问相关信息,并且在此过程中也已人工手动检查了Devin运行情况。

最后团队强调Devin仍处于起步阶段,还有很大改进空间:

更多细节感兴趣的家人们可查看报告详情。

Devin发布不到一周,网友们的讨论(Discuss)已十分热烈。

比如,这位大兄弟表示自己一年前担心的事儿终究还是发生了。

以后Stack Overflow上都是各种Devin在提问,人,就只能被挤出去(Stack Overflow危!!!):

有网友回复(手动狗头):

它们(They)可以互相回答问题。

还有网友发现Devin背后团队Cognition正在招全职软件工程师,于是缓缓打出一个问号:

Devin不是应该填补这些职位空缺来为他们(They)省钱吗?

最后,若Devin公开你会想用它干点啥?

参考链接:[1]https://www.cognition-labs.com/post/swe-bench-technical-report[2]https://x.com/raunakdoesdev/status/1769066769786757375[3]https://twitter.com/emollick/status/1768742585122558063[4]https://x.com/mckaywrigley/status/1767985840448516343[5]https://x.com/maisaAI_/status/1768657114669429103?s=20

本文来自微信公众号“量子位”(ID:QbitAI),作者:梦晨 西风,36氪经授权发布。

该文观点仅代表作者本人,36氪平台仅提供信息存储空间服务。

+193

好文章,需要你的鼓励

量子位特邀作者46收  藏+11评  论打开微信“扫一扫”,打开网页后点击屏幕右上角分享按钮微  博沉浸阅读返回顶部参与评论评论千万条,友善第一条登录后参与讨论(Discuss)提交评论0/1000你可能也喜欢这些文章我在技​​术面试中用 ChatGPT 作弊,没人知道我问了 Gemini 1.5 Pro 五个问题,找到了初遇ChatGPT的感觉国内创业者和投资人如何看待 Figure 01 机器人:距离具身智能还有多远?180亿,阿里又投出一家AI独角兽大模型进家电,既缺锤子又缺钉子?苹果为杀入AI领域低调收购,iOS 18要有大动作苹果300亿参数大模型首亮相,还买了家AI公司|焦点分析流浪地球里的数字生命计划启动了?DeepMind在电脑(Computer)里造果蝇,网友:能造人吗?OpenAI再陷巨大争议?Sora训练数据被质疑非法,CTO采访疯狂翻车最新文章推荐不麻也不辣的甘肃麻辣烫,让连吃5年杨国福的北漂破防了上海诞生一个氢能IPO,100亿AI程序员Devin卧底工作群修bug!和CTO聊技术,网友:顶级码农水平这家融了26轮的公司快破产了我在技​​术面试中用 ChatGPT 作弊,没人知道怎么连山姆也开始流行“穷鬼套餐”了?我问了 Gemini 1.5 Pro 五个问题,找到了初遇ChatGPT的感觉云南药企老板被坑,加拿大豪宅专割华人富豪韭菜?国内创业者和投资人如何看待 Figure 01 机器人:距离具身智能还有多远?180亿,阿里又投出一家AI独角兽量子位特邀作者

作者有点忙,还没写简介

发表文章2090篇最近内容AI程序员Devin卧底工作群修bug!和CTO聊技术,网友:顶级码农水平1小时前开源版“Devin”AI程序员炸场:自己分析股票、做报表、建模型2024-03-15OpenAI大模型上身机器人,原速演示炸场2024-03-14阅读更多内容,狠戳这里下一篇这家融了26轮的公司快破产了

资金只能烧到2025年。

2小时前

热门标签阿尔忒弥斯旭化成孙权轨道火车李立新湖南邵阳夏梦专升本和本科的区别统招专升本河南专升本陕西专升本浙江专升本湖北专升本山东专升本cam宋林奥林巴斯显微镜柯达破产匈牙利移民打底衫俏佳人便便基因结构固德威刘丽丽龙之家族万兴科技(Technology)邢峰今年(This Year)16号台风17号台风关于36氪城市合作寻求报道我要入驻投资者关系商务合作关于我们(We)联系我们(We)加入我们(We)网站谣言信息举报入口热门推荐热门资讯热门产品文章标签快讯标签合作伙伴阿里云火山引擎高德个推星球日报(Daily)鲸准氪空间富途牛牛企服点评人人都是产品经理领氪36氪APP下载iOS Android36氪本站由 阿里云 提供计算与安危服务 违法和不良信息、未成年人保护举报电话:010-89650707 举报邮箱:jubao@36kr.com 网上有害信息举报© 2011~2024 首都多氪信息科技(Technology)有限公司 | 京ICP备12031756号-6 | 京ICP证150143号 | 京公网安备11010502036099号意见反馈36氪APP让一部分人先看到将来36氪鲸准氪空间

推送和解读前沿、有料的科技(Technology)创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业

AI程序员Devin卧底工作群修bug!和CTO聊技术,网友:顶级码农水平

您可能还会对下面的文章感兴趣:

赞(362) 踩(67) 阅读数(9328) 最新评论 查看所有评论
加载中......
发表评论