Datawhale干货
作者: 北大 OpenDCAI 团队
大模型训练、微调和 RAG 知识库建设,不论怎么选技术路线,都绕不开数据准备。而准备一份高质量的 AI-ready 数据集,恰恰是 LLM 落地最难啃的骨头。
目前常见的解决方式还是由工程师手搓脚本,或者交给 Code Agent 生成一次性脚本后再拼接,但这两种方式在流程复用、平台审计、可视化编辑和长期治理上都存在明显短板,难以输出高质量数据集,最终影响应用效果。
这正是 DataFlow-Harness 试图解决的问题。
北京大学 DCAI 团队联合上海算法创新研究院、北京中关村学院,发布最新工作成果《DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines》,上线后登上 HuggingFace Papers 榜单 Paper of the day。
论文提出了一个核心概念:NL2Pipeline gap——用户表达的是自然语言工作流意图,而生产环境需要的是可检查、可编辑、可复用的平台原生流水线,二者之间存在鸿沟。因此,团队基于 DataFlow 开源生态,叠加了 Harness 工程约束,让 Agent 在真实平台的边界内做数据处理,输出可检查、可编辑、可复用的平台原生 Pipeline。
DataFlow-Harness 的平台交互入口是 DataFlow-WebUI,它同时提供了两种操作方式——用户既可以在对话窗口里用口语描述需求,让 Agent 自动搭建工作流;也可以直接在 DAG 画布上拖拽、调参、改连线,两种模式共享同一个 Pipeline 状态。
一、为什么需要 Harness,而不是直接让模型处理数据
在真实的落地场景中,靠临时脚本或通用 Agent 处理数据,反复会卡在三个大问题上。
第一,脚本通常是一次性的。它可以完成当前任务,却很难进入平台的长期生命周期。数据团队很难在图形化界面里审计它、修改它、复用它,也很难把它变成一条标准的数据资产。
第二,模型容易产生幻觉。它可能调用不存在的算子,假设某个参数存在,或者基于过时的框架知识写出看似合理但无法接入平台的流程。基础模型能力越强,越容易让人误以为它可以解决数据工程问题,但实际上生产系统需要的是可验证的 operator、schema、依赖关系和执行状态。
第三,复杂数据处理是多阶段流水线构造。一个高质量数据集往往要经过生成、清洗、评估、过滤、去重、格式化等多个环节。难点在于需要知道如何组合工具,字段如何流转,哪些步骤必须前置,哪些质量检查不能省等问题。
二、DataFlow-Harness 架构设计:让数据引擎成为 Agent 底座
DataFlow-Harness 的系统架构围绕四个核心组件展开:Data Pipeline Backend、DataFlow-WebUI、MCP Tools Layer 和 DataFlow-Skills。
DataFlow-Harness 架构图
Data Pipeline Backend是整个系统的状态中心。DataFlow-Harness 将一条 pipeline 表示为 P = (D, O, E, S, R):D表示数据源,O表示配置好的算子实例,E表示算子之间的有向依赖边,S记录输入输出字段 Schema,R保存运行状态,例如模型服务端点。所有对流水线的修改都会进入这个后端状态中。
MCP Tools Layer负责把 Code Agent 的意图变成结构化操作。Agent 不直接写自由脚本,而是通过 typed mutations 修改 pipeline,例如添加算子、删除算子、更新参数、连接节点。每次修改都会经过 Request-Validate-Commit 流程:先获取当前状态,再提交结构化变更,然后检查 DAG 是否无环、相邻算子的 Schema 是否兼容,最后写入后端。
DataFlow-Skills提供流程知识。它编码算子选择模式、Schema 依赖关系、参数配置经验和流水线装配步骤,帮助 Agent 处理需要程序性经验的复杂任务。对于 QA 生成、VQA 抽取、长文档处理这类任务,Agent 需要的不只是工具列表,还需要知道工具组合顺序。
DataFlow-WebUI提供交互和可视化承载。用户可以通过对话迭代需求,也可以在 DAG 画布上检查、编辑和运行流水线。WebUI 与后端共享同一份 pipeline 状态,手动修改和 Agent 修改会同步到同一个工作流中。后端提交变更后,系统通过 WebSocket 更新前端画布,保证对话界面和可视化 DAG 保持一致。
这套架构让自然语言数据需求进入 DataFlow 平台生命周期。用户表达目标,Agent 结合 Skills 规划流程,通过 MCP 操作真实环境,后端完成校验和提交,WebUI 将结果呈现为持久化、可编辑、可复用的 DAG 流水线。
三、封装成 Harness 之后,性能没有下降
在 12 个数据工程任务中,DataFlow-Harness 覆盖数据转换、问答生成、质量过滤、长文档处理、Schema 规范化等典型场景。每种方法运行 120 次,用端到端通过率、Token 使用量、成本和生成延迟衡量整体表现。
下一篇:没有了