AI 数据最难搞的 Harness 工程,被北大开源了!
创始人
2026-07-26 18:15:55
0

Datawhale干货

作者: 北大 OpenDCAI 团队

大模型训练、微调和 RAG 知识库建设,不论怎么选技术路线,都绕不开数据准备。而准备一份高质量的 AI-ready 数据集,恰恰是 LLM 落地最难啃的骨头。

目前常见的解决方式还是由工程师手搓脚本,或者交给 Code Agent 生成一次性脚本后再拼接,但这两种方式在流程复用、平台审计、可视化编辑和长期治理上都存在明显短板,难以输出高质量数据集,最终影响应用效果。

这正是 DataFlow-Harness 试图解决的问题。

北京大学 DCAI 团队联合上海算法创新研究院、北京中关村学院,发布最新工作成果《DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines》,上线后登上 HuggingFace Papers 榜单 Paper of the day。

论文提出了一个核心概念:NL2Pipeline gap——用户表达的是自然语言工作流意图,而生产环境需要的是可检查、可编辑、可复用的平台原生流水线,二者之间存在鸿沟。因此,团队基于 DataFlow 开源生态,叠加了 Harness 工程约束,让 Agent 在真实平台的边界内做数据处理,输出可检查、可编辑、可复用的平台原生 Pipeline。

DataFlow-Harness 的平台交互入口是 DataFlow-WebUI,它同时提供了两种操作方式——用户既可以在对话窗口里用口语描述需求,让 Agent 自动搭建工作流;也可以直接在 DAG 画布上拖拽、调参、改连线,两种模式共享同一个 Pipeline 状态。

论文地址: https: //huggingface.co/papers/2607.16617 开源仓库( DataFlow- Harness工程交互入口): https: //github.com/OpenDCAI/DataFlow-WebUI 开源仓库( DataFlow主库): https: //github.com/OpenDCAI/DataFlow

一、为什么需要 Harness,而不是直接让模型处理数据

在真实的落地场景中,靠临时脚本或通用 Agent 处理数据,反复会卡在三个大问题上。

第一,脚本通常是一次性的。它可以完成当前任务,却很难进入平台的长期生命周期。数据团队很难在图形化界面里审计它、修改它、复用它,也很难把它变成一条标准的数据资产。

第二,模型容易产生幻觉。它可能调用不存在的算子,假设某个参数存在,或者基于过时的框架知识写出看似合理但无法接入平台的流程。基础模型能力越强,越容易让人误以为它可以解决数据工程问题,但实际上生产系统需要的是可验证的 operator、schema、依赖关系和执行状态。

第三,复杂数据处理是多阶段流水线构造。一个高质量数据集往往要经过生成、清洗、评估、过滤、去重、格式化等多个环节。难点在于需要知道如何组合工具,字段如何流转,哪些步骤必须前置,哪些质量检查不能省等问题。

二、DataFlow-Harness 架构设计:让数据引擎成为 Agent 底座

DataFlow-Harness 的系统架构围绕四个核心组件展开:Data Pipeline Backend、DataFlow-WebUI、MCP Tools Layer 和 DataFlow-Skills。

DataFlow-Harness 架构图

Data Pipeline Backend是整个系统的状态中心。DataFlow-Harness 将一条 pipeline 表示为 P = (D, O, E, S, R)D表示数据源,O表示配置好的算子实例,E表示算子之间的有向依赖边,S记录输入输出字段 Schema,R保存运行状态,例如模型服务端点。所有对流水线的修改都会进入这个后端状态中。

MCP Tools Layer负责把 Code Agent 的意图变成结构化操作。Agent 不直接写自由脚本,而是通过 typed mutations 修改 pipeline,例如添加算子、删除算子、更新参数、连接节点。每次修改都会经过 Request-Validate-Commit 流程:先获取当前状态,再提交结构化变更,然后检查 DAG 是否无环、相邻算子的 Schema 是否兼容,最后写入后端。

DataFlow-Skills提供流程知识。它编码算子选择模式、Schema 依赖关系、参数配置经验和流水线装配步骤,帮助 Agent 处理需要程序性经验的复杂任务。对于 QA 生成、VQA 抽取、长文档处理这类任务,Agent 需要的不只是工具列表,还需要知道工具组合顺序。

DataFlow-WebUI提供交互和可视化承载。用户可以通过对话迭代需求,也可以在 DAG 画布上检查、编辑和运行流水线。WebUI 与后端共享同一份 pipeline 状态,手动修改和 Agent 修改会同步到同一个工作流中。后端提交变更后,系统通过 WebSocket 更新前端画布,保证对话界面和可视化 DAG 保持一致。

这套架构让自然语言数据需求进入 DataFlow 平台生命周期。用户表达目标,Agent 结合 Skills 规划流程,通过 MCP 操作真实环境,后端完成校验和提交,WebUI 将结果呈现为持久化、可编辑、可复用的 DAG 流水线。

三、封装成 Harness 之后,性能没有下降

在 12 个数据工程任务中,DataFlow-Harness 覆盖数据转换、问答生成、质量过滤、长文档处理、Schema 规范化等典型场景。每种方法运行 120 次,用端到端通过率、Token 使用量、成本和生成延迟衡量整体表现。

相关内容

热门资讯

AI 数据最难搞的 Harne... Datawhale干货作者:北大OpenDCAI团队大模型训练、微调和RAG知识库建设,不论怎么选技...
花旗AI追踪:模型越来越强,但... AI大模型正在变得越来越聪明,但承载它们的物理世界正在被推向极限。花旗在7月24日发布的最新报告中写...
锚定万兆AI底座,雄安论道园区... 当人工智能从技术试点走向AIAgent落地千行百业,一个关键命题正浮出水面:承载流量爆发的网络准备好...
AI下一步将迈向何方?一场正在... 文|JHMS贝壳2024年底,《美国天文学杂志》发表了一篇论文。论文只有一位作者,不是资深教授,不是...
同质化“AI脸”可以休矣!抖音... 搜狐娱乐专稿(胖部/文)过去几个月,“AI脸”带来的“生理性厌恶”,正在成为广泛讨论的话题。男主统一...
国家工业信息安全发展研究中心:... 国家工业信息安全发展研究中心主任江明涛在APEC数字周期间接受澎湃新闻记者等媒体采访。澎湃新闻记者赵...
燧原科技申请开源软件全生命周期... 国家知识产权局信息显示,上海燧原科技股份有限公司申请一项名为“一种开源软件全生命周期管理方法、设备、...
黄仁勋首发推文力挺AI开源模型... 7月24日晚间,英伟达首席执行官黄仁勋在社交平台X发布个人入驻后的第一条推文,并未推介公司芯片与产品...
Linux 7.2内核实测:英... 快科技7月22日消息,据Phoronix最新实测,在即将发布的Linux7.2内核中,搭载的ArcB...