Data-Juicer 演进时间线全解析:从多模态数据处理到云规模数据工程的版本脉络

发布时间:2026/10/4 1:46:50
Data-Juicer 演进时间线全解析:从多模态数据处理到云规模数据工程的版本脉络 人工智能大模型数据工程数据清洗数据增强数据质检【免费下载链接】data-juicerData processing for and with foundation models! ➡️ ➡️ 项目地址https://gitcode.com/gh_mirrors/da/data-juicer点击查看免费下载导读本文以仓库根目录下 docs/news.md 为骨架系统梳理 Data-Juicer 自 2023 年 10 月至 2026 年 1 月的完整演进时间线涵盖 v0.1.3 到 v1.4.5 六次关键版本发布的能力变化、以 Data-Juicer 2.0 为代表的系列学术成果NeurIPS25 / ICML25 / CVPR25 / TPAMI 等、与 Ray / Apache Arrow 的生态集成以及四届数据竞赛的推进脉络。读完本文你将掌握每个版本新增了什么能力、对应仓库中哪些源码模块的对应关系并能在当前仓库中按图索骥地验证这些能力。一、news.md 是什么一份记录项目成长的官方时间线docs/news.md是 Data-Juicer 官方维护的新闻/发布记录文档采用时间倒序排列最新条目在最上方覆盖 2023-10-13 至 2026-01-15 的两年余时间。其内容大致可分为四类版本发布v0.1.3、v0.2.0、v1.0.0/v1.0.2/v1.0.3、v1.4.4、v1.4.5 等具体版本及其功能清单学术成果被 NeurIPS、ICML、CVPR、TPAMI、SIGMOD 等顶会/顶刊接收的论文与配套数据集生态集成与 Ray 官方生态、Apache Arrow、HuggingFace、ModelScope 的整合社区活动连续四届以数据为中心的 LLM/多模态数据竞赛。该文档同时内嵌了对仓库其他文档的相对链接例如 DJ_SORA.mdSORA 类模型开源数据集说明与 awesome_llm_data.mdLLM 数据资源精选列表在阅读新闻时可以直接跳转深入。二、版本发布主线v0.1.3 → v1.4.5 的能力演进下面按时间正序展开版本主线每条均对照当前仓库源码给出可验证的实现证据。2.1 v0.1.3多模态支持与 Python 版本扩展2024-01-05这是文档中可追溯的最早版本发布核心变化有三点支持更多 Python 版本3.8-3.10降低部署门槛支持多模态数据集转换与处理涵盖文本、图像、音频为后续视频模态铺路论文更新至 v3。在仓库中多模态转换能力沉淀于 tools/fmt_conversion/multimodal/ 目录其 README 提供了文本/图像/音频数据在不同开源格式间的转换指引多模态处理算子则统一注册在data_juicer/ops下可通过 docs/Operators.md 查阅完整算子清单。2.2 v0.2.0视频模态与 DJ-SORA 数据集2024-03-07v0.2.0 将多模态支持正式扩展到视频并引入 DJ-SORA 计划——面向 SORA 类视频生成模型提供开放的大规模高质量数据集。当前仓库中docs/DJ_SORA.md 详细阐述了 DJ-SORA 的数据规范与使用方法视频处理链路已有完整实操示例见 demos/process_video_on_ray/内含在 Ray 集群上处理视频数据的配置与数据样例。2.3 v1.0.0Operator / Dataset / Sandbox 重构与工程化2024-11-22v1.0.0 是一次以可用性为目标的架构重构新闻原文明确列出三项能力容错fault-tolerant、FastAPI 服务、自适应资源管理。在源码中可对应到算子与执行引擎重构执行器家族集中在 data_juicer/core/executor/包括默认执行器 default_executor.py、基于 DAG 的 dag_execution_mixin.py 与 dag_execution_strategies.py事件日志与容错event_logging_mixin.py 记录执行事件日志为断点续跑与故障定位提供基础自适应资源管理partition_size_optimizer.py 与 gpu_memory_probe.py 分别负责分区大小优化与 GPU 显存探测FastAPI 服务仓库根目录的 service.py 提供服务化入口配套的 API 调用示例见 demos/api_service/。2.4 v1.0.2 / v1.0.3Post-tuning 场景与统一数据集格式2025-01-03这一条目关注后训练post-tuning场景一方面通过 20 个新算子强化数据加工另一方面推出统一数据集格式与 LLaMA-Factory、ModelScope-Swift 兼容。仓库中的格式层位于 data_juicer/format/其中 load.py 负责数据加载配套的 json/parquet/tsv/csv/text 等格式实现均有独立模块与测试见 tests/format/从源码结构看这正是一次加工、多框架复用的统一格式能力的落地位置。2.5 v1.4.4仓库拆分、S3 I/O 与视频/多模态新算子2025-12-01v1.4.4 的三项核心变化仓库拆分Sandbox、Recipes、Agents 相关代码被拆分到独立仓库使主仓库聚焦核心数据处理能力S3 I/O加载器与导出器支持 S3 对象存储。源码证据data_juicer/utils/s3_utils.py 中提供get_aws_credentials第 33 行起、create_pyarrow_s3_filesystem第 70 行起与validate_s3_path第 116 行起等工具加载策略 load_strategy.py 与导出器 exporter.py、ray_exporter.py 均已接入另有 s3_download_file_mapper.py 与 s3_upload_file_mapper.py 两个专用算子6 个视频/多模态新算子人物检测detect_character_attributes_mapper.py 等、VGGTvggt_mapper.py、全身姿态video_whole_body_pose_estimation_mapper.py、手部重建video_hand_reconstruction_mapper.py 与 video_hand_reconstruction_hawor_mapper.py等。此外该条目还记录了 Data-Juicer 2.0 论文获NeurIPS25 Spotlight的消息详见第四节。2.6 v1.4.5embodied-AI 视频算子与 Ray vLLM Pipeline OP2026-01-15这是当前文档中最新的版本功能密度最高20 新算子聚焦 embodied-AI 视频场景视频描述生成如 video_captioning_from_vlm_mapper.py、video_captioning_from_frames_mapper.py、video_captioning_from_human_tracks_mapper.py、目标分割video_object_segmenting_mapper.py基于 SAM2默认模型为facebook/sam2.1-hiera-tiny见第 33 行、深度估计video_depth_estimation_mapper.py默认模型video_depth_anything_vitb.pth见第 33-34 行、人体姿态video_whole_body_pose_estimation_mapper.py基于 DWPose、图像打标image_tagging_vlm_mapper.py、3D 人体网格image_sam_3d_body_mapper.py等新型 Pipeline OP将 Ray 与 vLLM 结合在集群上以流式方式对数据集执行 LLM/VLM 推理。源码位于 data_juicer/ops/pipeline/其中 llm_inference_with_ray_vllm_pipeline.py 注册算子名llm_ray_vllm_engine_pipeline第 13 行支持通过api_or_hf_model指定模型、is_hf_model区分 HF 模型与 API、sampling_params控制采样参数如{temperature: 0.9, top_p: 0.95}、engine_kwargs透传 vLLM 引擎参数同类实现还有 vlm_inference_with_ray_vllm_pipeline.py、ray_vllm_pipeline.py 与 ray_repartition_pipeline.pySphinx 文档升级文档工程位于 docs/sphinx_doc/Docker 基础镜像更新仓库根目录 Dockerfile 第 4 行即FROM nvidia/cuda:12.6.3-cudnn-devel-ubuntu24.04并在镜像内安装 Python 3.11 与 uv与新闻描述完全一致。三、新算子矩阵从文档条目到源码实现将各版本新增算子与源码路径汇总如下便于按功能查找版本新增能力仓库实现位置v0.1.3文本/图像/音频多模态处理data_juicer/ops/、tools/fmt_conversion/multimodal/v0.2.0视频模态demos/process_video_on_ray/、docs/DJ_SORA.mdv1.0.0容错、FastAPI、自适应资源管理data_juicer/core/executor/、service.pyv1.0.2/0320 post-tuning 算子、统一数据集格式data_juicer/format/、tests/format/v1.4.4S3 I/O、人物检测、VGGT、全身姿态、手部重建data_juicer/utils/s3_utils.py、data_juicer/ops/mapper/v1.4.5embodied-AI 视频描述/分割/深度/姿态/打标/3D 网格、RayvLLM Pipelinedata_juicer/ops/pipeline/、data_juicer/ops/mapper/以运动分数过滤器为例可以直观看到算子参数与源码的对应video_motion_score_filter.py 注册算子名video_motion_score_filter第 16 行其_default_kwargs第 40-48 行给出 Farneback 稠密光流算法的默认参数pyr_scale0.5、levels3、winsize15、iterations3、poly_n5、poly_sigma1.2构造参数min_score/max_score控制保留区间、sampling_fps控制抽帧采样频率、relative决定是否按帧对角线归一化运动分数——这类参数细节正是将新闻条目落地为可复现配置的关键。四、学术成果时间线以数据为中心的系列研究news.md 记录了数据-juicer 团队围绕数据加工、数据选择、数据合成与数据-模型协同发展的系列成果按时间正序整理如下。4.1 早期奠基SIGMOD24 与多模态综述2024-02-05论文被 SIGMOD24 工业轨industrial track接收标志着数据处理系统方向获得数据库领域顶会认可2024-07-12MLLM-Data 精选列表升级为系统性的数据-模型协同发展综述当前仓库中的 awesome_llm_data.md 即为该列表的持续维护版本。4.2 Data-Juicer 2.0云规模自适应数据处理NeurIPS25 Spotlight2025-01-11发布 2.0 论文公布关键性能数据——在阿里云集群的50 个 Ray 节点、6400 CPU 核心上2.1 小时内处理700 亿数据样本在8 个 Ray 节点、1280 CPU 核心上2.8 小时内完成5TB数据去重2025-09-19该论文被接收为NeurIPS25 Spotlight官方称位列全部投稿的前 3.1%。4.3 Data-Juicer Sandbox数据-模型协同优化ICML25 Spotlight2024-07-17利用 Sandbox 实验室套件以数据-模型协同开发工作流系统优化数据与模型在 VBench 文生视频榜单取得榜首据文档记载相关模型发布于 ModelScope 与 HuggingFace2025-05-06Sandbox 论文被接收为ICML25 Spotlight官方称位列全部投稿的前 2.6%。仓库中可参考的配套演示包括 demos/data_process_loop/数据处理循环与 demos/data_mixture/数据配比。4.4 对比式数据合成ImgDiffCVPR252024-08-09提出 Img-Diff通过对比式数据合成增强多模态大模型官方称在 MMVP 基准上得分比 GPT-4V 高 12 分并发布了配套数据集2025-02-27ImgDiff 论文被CVPR25接收。4.5 数据选择与合成Diversity as a Reward、MindGYM2025-02-05提出 Diversity as a Reward 数据选择方法——将多样性作为奖励函数官方称在 7 个基准上取得更好综合表现2025-03-13提出 MindGYM 数据合成方法使大模型能自合成高质量、低方差的数据用于高效微调官方称仅用400 条样本即在 MathVision 上获得16%的提升2025-09-19上述两篇论文同被NeurIPS25接收。4.6 强化微调与评测Trinity-RFT、DetailMaster、HumanVBench2025-06-04提出 Trinity-RFT面向经验时代的反馈数据处理构建统一通用的 LLM 强化微调RFT框架其数据管线即由 Data-Juicer 支撑2025-06-04推出 DetailMaster——面向文生图长提示词的合成基准官方称揭示了即便大模型擅长短描述在长提示词下性能仍显著下降的现象2024-12-17提出 HumanVBench包含 16 个人类中心任务与合成数据从内在情感与外在表现两个视角评测 22 个视频多模态大模型。仓库配套的轻量演示见 demos/video_humanvbench_simple/2025-06-04数据-模型协同发展综述被 IEEE TPAMI 接收。五、生态集成与数据发布5.1 Ray 官方生态与 Apache Arrow2025-02-28Data-Juicer 被集成进Ray 官方生态系统与示例库分布式数据处理能力获得官方背书。这一点在当前仓库的 Ray 执行器ray_executor.py、ray_executor_partitioned.py与 Pipeline 算子中均可得到印证同一消息还记录了 DJ 2.0 中面向流式 JSON 读取器的补丁被 Apache Arrow 官方集成。仓库中与之功能相关的宽松 JSONL 加载器为 data_juicer/utils/jsonl_lenient_loader.py。5.2 数据集与模型发布渠道新闻多次提及配套数据集/模型发布在 HuggingFace 与 ModelScope 平台如 Img-Diff 数据集、Data-Juicer-T2V 模型并持续维护精选列表。仓库内可阅读的对应资料包括 docs/awesome_llm_data.md 与 docs/DJ_SORA.md。需要说明的是本仓库为只读镜像下载模型与数据集请通过上述平台官方页面操作。六、数据竞赛以竞赛驱动社区的数据工程实践news.md 记录了连续四届以数据为中心的竞赛构成了社区参与生态的重要一环2023-10-13首届数据竞赛 FT-Data Ranker分 1B 与 7B 两条赛道2024-01-10第二届主题聚焦数据配比Data Mixture2024-06-01第三届与 ModelScope-Sora 合作以Sora 数据导演为主题2024-07-24第四届主题为多模态大模型的更好合成数据Better Synth Data。从时间线看竞赛主题的演进微调数据 → 数据配比 → 视频生成数据 → 合成数据与 Data-Juicer 自身能力扩展文本 → 多模态 → 视频 → 数据合成保持同步体现了以任务驱动数据处理能力迭代的项目节奏。七、从时间线到实践如何在当前仓库验证这些能力若希望将新闻中的能力落地为实际使用可遵循以下路径在仓库中逐一验证查看完整算子清单阅读 docs/Operators.md 与 docs/operators/ 下的分类文档filter、mapper、deduplicator、selector 等了解每个算子的参数与示例从示例配置入手参考 demos/process_simple/process.yaml 编写最小处理流程再进阶到 demos/process_on_ray/ 与 demos/process_video_on_ray/ 的分布式/视频配置了解数据格式阅读 docs/DatasetCfg.md 与 docs/ProcessData.md配合 docs/tutorial/DJ-Cookbook.md 系统上手深入源码需要确认某个算子实现时按第三节的矩阵定位到data_juicer/ops/下对应文件参考其 docstring 与默认参数直接使用。结语从 2023 年秋的首场竞赛与 v0.1.3 的多模态起步到 2026 年初 v1.4.5 的 embodied-AI 视频算子与 RayvLLM 流水线docs/news.md用两年余的条目勾勒出一条清晰的技术演进主线数据处理能力从文本走向多模态、再走向视频与 3D 物理世界运行规模从单机走向 Ray 云集群定位从数据工具走向数据-模型协同开发的工程平台。这一时间线不仅是项目成长的记录更是理解当前仓库各模块设计动机与能力的索引——结合本文给出的源码对应关系你可以据此快速定位所需功能并投入实际使用。赞分享人工智能大模型数据工程数据清洗数据增强数据质检【免费下载链接】data-juicerData processing for and with foundation models! ➡️ ➡️ 项目地址https://gitcode.com/gh_mirrors/da/data-juicer点击查看免费下载相关推荐MBPFan架构解析与智能温控实现原理MBPFan架构解析与智能温控实现原理 在Linux系统上运行MacBook的技术爱好者常面临散热管理难题处理器温度波动导致风扇噪音过大或散热不足。MBPFaData-Juicer多模态数据处理实战文本、图像、音频、视频全解析在大模型时代高质量数据是AI成功的基石。Data Juicer作为一站式数据处理系统为开发者提供了一套完整的解决方案让文本、图像、音频、视频等多模态数据变人工智能大模型数据工程数据清洗数据增强数据质检MMagic 版本演进全记录从 MMEditing 到多模态 AIGC 工具箱的 1.x 技术脉络MMagic 版本演进全记录从 MMEditing 到多模态 AIGC 工具箱的 1.x 技术脉络 本文以 docs/zh_cn/changelog.md h媒体生成计算机视觉深度学习人工智能大模型上一篇揭开Funny-Lidar-SLAM神秘面纱前端特征提取与后端优化原理终极指南下一篇为什么选择Lore五大核心优势助你提升开发效率创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询