清华SIGS团队开源代码模型获多项评测第一
创始人
2026-08-17 07:52:10
0

深圳特区报讯(记者 李丽 通讯员 王立博 吴鸿瑶)写代码的AI不少,但能像科学家一样“先假设、再验证、错了就改、改完再验”的AI,还真不多见。近日,清华大学深圳国际研究生院(SIGS)刘厚德教授、王立博博士后团队正式开源了一款代码大模型——VeriLoop Coder-E1(中文名:循证),这款模型专门解决真实软件工程中的代码修复问题。它的特别之处在于:不是让AI闷头写代码、写错了再重来,而是给它装了一套“循证闭环”,每一轮生成的代码都必须经过测试验证,通不过就分析原因、修正错误,然后再验证,直到产出可靠代码。

该模型通过宿主侧表层参数高效微调适配器与自驱式闭环智能体运行框架协同,将代码生成、工具调用、测试反馈、错误修正和回归控制组织为可持续迭代的闭环,为代码智能体由程序文本生成向仓库状态理解、修改执行与结果验证演进提供新方案。

截至2026年7月27日,根据Hugging Face平台公开社区榜单收录的团队发布(self-published)评测结果,VeriLoop Coder-E1在32B及以下开源模型中,前三项位列第一,软件工程智能体基准位列第二;在全部开源模型中,四项分别位列第二、第一、第一和第五。比测对象中包括DeepSeek-V4-Pro、MiniMax-M3、GLM-5.2、Kimi-K3、Qwen3.6-27B等知名大模型版本。

相关内容

热门资讯

科创001|豪赌AI的互联网大... 深圳商报·读创客户端首席记者陈小慧今年8月12日,腾讯公布了一份“震惊所有人”的财报。腾讯2026年...
企业AI落地,用友的关键词是“... 作者:高飞2026年春天,AI工程界突然被一个词点燃。HarnessEngineering,中文译作...
原创 高... 8月13号晚上,DeepSeek把它的第一款智能体框架DeepSeekHarness开源了,MIT协...
原创 「... 01最近看了一些简历,发现「熟练使用AI」「掌握各类AI工具」,正在成为一种新的标准表述。当一种能力...
“AI依赖”会发展成“AI成瘾... 参考消息网8月17日报道据美国《福布斯》杂志网站近日报道,一种新的习惯正在世界各地的家庭和办公室悄然...
尴尬:美国制定AI监管规则的议... IT之家8月17日消息,律师因引用AI编造的案例而被抓包,大型咨询公司用AI生成逻辑混乱的报告,教师...
世界模型一口气输出小时级视频不... AlayaLab团队投稿量子位|公众号QbitAI视频世界模型跑久了,往往面临三个问题:画面发灰发糊...
开源证券:给予小熊电器买入评级 开源证券股份有限公司吕明,林文隆近期对小熊电器进行研究并发布了研究报告《公司信息更新报告:2026Q...
智能体AI崛起,CPU成为新性... 今年早些时候,亚马逊云服务(AWS)的高层向工程师下达了一项新指令:必须不惜一切代价节省CPU算力。...
官方实锤!Windows 11... 不知不觉,Windows11上的Ubuntu的增速,已经将超过原生桌面了。Canonical预计,未...