Argilla 数据协作平台入门指南:面向 AI 工程师与领域专家构建高质量数据集

发布时间:2026/9/18 10:07:18
Argilla 数据协作平台入门指南:面向 AI 工程师与领域专家构建高质量数据集 Argilla 数据协作平台入门指南面向 AI 工程师与领域专家构建高质量数据集【免费下载链接】argillaArgilla is a collaboration tool for AI engineers and domain experts to build high-quality datasets项目地址: https://gitcode.com/GitHub_Trending/ar/argillaArgilla 是一个面向AI 工程师与领域专家的协作工具用于构建高质量数据集覆盖传统 NLP文本分类、命名实体识别等、LLMRAG、偏好对齐等与多模态模型文生图等场景。本文基于仓库内 argilla/docs/index.md 的官方文档主线结合 argilla 主仓库的 Python SDK 源码、argilla-server 服务端实现与集成测试系统讲解 Argilla 的定位、核心资源模型、部署与首个数据集创建流程帮助读者快速掌握从零搭建数据标注与模型迭代闭环的完整路径。Argilla 是什么一个以数据为中心的协作平台Argilla 的核心定位是协作工具它连接 AI 工程师与领域专家两类角色让团队围绕数据展开分工与协作。与常见的黑盒 AI 工具不同Argilla 坚持让团队同时拥有数据与模型的控制权并提供全部所需的工具来按团队自己的方式管理二者。这一设计理念在仓库的源码结构中可以得到印证。主仓库 argilla/src/argilla/client.py 中定义了 SDK 的唯一入口类Argilla其文档字符串明确指出Argilla API client. This is the main entry point to interact with the API.Argilla类同时继承APIClientHTTP 通信层与SpacesDeploymentMixinHugging Face Spaces 部署能力并通过四个集合属性暴露了平台的核心资源域属性说明对应源码client.workspaces工作区集合client.pyclient.datasets数据集集合client.pyclient.users用户集合client.pyclient.webhooksWebhook 集合client.pyclient.me当前登录用户client.pyme是一个cached_property底层通过self.api.users.get_me()从服务端拉取当前用户信息是验证客户端凭据是否正确的标准手段。为什么使用 Argilla三大核心理念官方文档从三个层面阐述了 Argilla 存在的理由这也是理解其产品形态的关键通过数据质量提升 AI 输出质量算力昂贵、输出质量重要而数据是这两类问题的共同根源。Argilla 帮助团队达成并维持数据的高质量标准从而直接改善 AI 输出的质量。文档用一句话概括了这一理念Improve your AI output quality through data quality通过数据质量提升 AI 输出质量。掌控自己的数据与模型大多数 AI 工具是黑盒Argilla 则主张团队应当同时拥有数据与模型的所有权。平台提供团队所需的全部工具让数据与模型的管理方式最适合自己——这体现在自托管部署、开放的 SDK、可编程的工作流等设计上。在正确的数据与模型上快速迭代以提升效率收集数据耗时耗力。Argilla 通过提供更有参与感的数据交互方式筛选、AI 反馈建议、语义搜索来加速标注让团队把时间投入到训练模型与监控性能上。平台采用**编程式programmatic**方法构建持续评估与模型改进的工作流目标是让你的数据工作有回报。核心资源模型Users、Workspaces、Datasets 与 Records官方文档将基础工作流概括为对四类资源的组织与管理Users用户、Workspaces工作区、Datasets数据集和 Records记录。这是所有标注项目的基础骨架。Users三种角色与权限边界Argilla 区分三种用户角色权限差异是数据治理的核心详见 argilla/docs/how_to_guides/user.md能力OwnerAdminAnnotator创建/删除工作区✅❌❌向工作区分配用户✅❌❌创建/配置/更新/删除数据集✅仅限被分配的工作区❌创建/更新/删除用户✅❌❌使用 UI 提供反馈✅✅✅Owner实例的根用户拥有全部工作区与全部管理权限Admin仅能访问被分配的工作区只能在该范围内管理数据集Annotator仅能访问工作区内分配给自己的数据集只能进行标注与反馈。从源码看Users 集合类支持按username或id检索用户、遍历用户列表、通过add(user)创建用户以及按工作区列出用户list(workspace...)。集成测试 argilla/tests/integration/test_client.py 验证了client.users(username...)、client.users(id...)等检索路径的行为一致性。Workspaces协作空间工作区是 Argilla 实例内的空间授权用户可以在此协作管理数据集通过 SDK 与 UI 均可访问。HF Spaces 部署默认创建名为argilla的工作区Docker 部署则需手动创建。仅owner角色可管理工作区admin只能读取其所属工作区。删除工作区的硬性前提是该工作区下没有任何数据集否则删除会失败详见 argilla/docs/how_to_guides/workspace.md。Datasets可定制的数据集配置数据集是一组记录Records的集合通过Settings配置决定标注者在 UI 中看到什么、回答什么。Settings 由六类配置构成详见 argilla/docs/how_to_guides/dataset.mdFields字段需要反馈的数据项支持TextField纯文本/Markdown、ImageField图片、ChatField对话、CustomField自定义模板UI 中的字段顺序与 SDK 中定义顺序一致Questions问题需要收集的反馈形式包括LabelQuestion单选、MultiLabelQuestion多选、RankingQuestion排序、RatingQuestion评分、SpanQuestion文本跨度标注适用于 NER/信息抽取、TextQuestion自由文本Metadata元数据TermsMetadataProperty枚举项、IntegerMetadataProperty、FloatMetadataProperty用于 UI 与 SDK 中的筛选排序allow_extra_metadataTrue时允许记录携带未声明的额外元数据仅 SDK 可读取Vectors向量通过VectorField声明维度启用相似度/语义搜索Guidelines指南数据集级标注指南与问题描述description一起帮助标注者统一标注口径Distribution任务分配通过TaskDistribution(min_submittedN)设置每条记录的最低提交响应数实现团队自动分工。Records需要标注的数据项记录Record是数据集中需要标注的最小单元由字段组成并可以附加**元数据、向量、建议Suggestions与响应Responses**四类附加信息Suggestions建议模型的预测结果用于加速标注每个问题最多一条建议值必须符合问题类型约束如评分在 1–5 之间Responses响应标注者或已有的人工标注每条响应须包含user_id以区分不同标注者否则将应用于所有标注者记录可来自Record对象、字典等通用数据结构或直接导入 Hugging Face 数据集并通过mapping参数实现源数据字段名与数据集字段名的映射。详细操作添加、更新、删除记录更新元数据/向量/建议/响应见 argilla/docs/how_to_guides/record.md。快速开始两条部署路线与 SDK 连接路线一Hugging Face Hub推荐5 分钟内启动这是官方推荐的起步方式无需维护服务器、无需执行命令有两种途径无代码方式点击 Space 模板创建按钮保持默认 Space 所有者个人账户USERNAME与PASSWORDsecrets 留空使用 HF 账户作为 Argilla Space 的owner登录创建后即可看到 Argilla UIPython SDK 方式调用Argilla.deploy_on_spaces方法自动完成部署。从源码 argilla/src/argilla/_helpers/_deploy.py 可以确认其自动化行为基于argilla/argilla-template-space模板复制 Space并以 Docker SDK 方式构建自动写入API_KEYowner 用户的 API 密钥与WORKSPACE默认argilla两个 secrets轮询 Space 运行时状态直至构建完成每 10 秒检查一次返回已认证的Argilla客户端可直接使用。deploy_on_spaces的可选参数如下均为源码确认的默认值参数默认值说明api_key必填owner 用户的 Argilla API 密钥长度须 ≥ 8 字符否则抛出ValueErrorrepo_nameargillaSpace 仓库名org_name当前 HF 用户名部署的目标组织hf_token自动获取HF 认证令牌缺省时依次尝试环境令牌、notebook_login()、login()space_storage无不持久化small/medium/large不设置时数据会在 Space 重启后丢失仅适合临时测试space_hardwarecpu-basicCPU 配置空闲 48 小时后休眠privateFalse是否创建私有 Space注意Space 模板的持久化存储建议设为SMALL。Space 会因维护、闲置、修改设置而重启未配置持久化存储将导致数据丢失FREE仅适合临时测试。路线二Docker 部署若需要在本地机器或自有服务器上运行、或需要精细调优服务端配置选择 Docker 方式具体见 argilla/docs/getting_started/how-to-deploy-argilla-with-docker.md。Docker 部署的初始凭据默认值为用户名argilla、密码12345678、API 密钥argilla.apikey。安装并连接 Python SDK在任何环境中推荐 Jupyter Notebook 或 Google Colab安装并连接!pip install argilla import argilla as rg client rg.Argilla( api_urlapi_url, api_keyapi_key )api_key位于 Argilla UI 的My Settings页面需以创建 Space 的owner账户登录api_url是浏览器中形如*.hf.space的地址若 UI 被嵌入 Hub 界面导致地址不匹配可在 Home 页点击 Import from the SDK 获取或直接使用https://[your-owner-name]-[your_space_name].hf.space模式。api_url缺省时回退到http://localhost:6900Docker 默认端口api_url与api_key均可通过环境变量ARGILLA_API_URL、ARGILLA_API_KEY提供连接超时默认 60 秒、重试默认 5 次这些默认值定义在 argilla/src/argilla/_api/_client.py 与Argilla.__init__见 client.py。验证连接是否成功调用client.me返回当前用户信息即可。创建你的第一个数据集官方快速入门提供了完整的最小可运行示例详见 argilla/docs/getting_started/quickstart.md。以下示例从 IMDB 评论构建一个文本二分类标注数据集import argilla as rg client rg.Argilla(api_urlapi_url, api_keyapi_key) settings rg.Settings( guidelinesClassify the reviews as positive or negative., fields[ rg.TextField( namereview, titleText from the review, use_markdownFalse, ), ], questions[ rg.LabelQuestion( namemy_label, titleIn which category does this article fit?, labels[positive, negative], ) ], ) dataset rg.Dataset( namemy_first_dataset, settingssettings, clientclient, ) dataset.create()随后从 Hugging Face Hub 导入前 100 条 IMDB 数据并写入数据集通过mapping将源列text映射到字段reviewfrom datasets import load_dataset data load_dataset(imdb, splittrain[:100]).to_list() dataset.records.log(recordsdata, mapping{text: review})创建完成后即可在 Argilla UI 中看到数据集并开始标注。值得注意的实现细节字段与问题可自动映射在 UI 的 Home 页选择 Import dataset from Hugging FaceArgilla 会自动解释数据集的列并映射为 Fields 与 Questions允许手动调整映射关系并可后续在 Dataset Settings 页修改标题等部分配置大数据集导入限制UI 导入仅处理前 1 万行其余记录可通过数据集内提供的 Import data 代码片段用 SDK 继续导入数据集创建后的更新边界数据集发布后字段的名称、必填性等不可修改而标题、Markdown 开关、模板仅 SDK可修改问题的标题、描述、标签顺序、可见标签数等可在 UI 修改但名称、标签集不可变元数据的标题与对标注者可见可改但名称、选项、数值范围不可改向量仅标题可改指南与min_submitted双向可改完整矩阵见 argilla/docs/how_to_guides/dataset.md 的 Update a dataset 一节。将数据集导回 Hub标注完成后可将数据集导出到 Hugging Face Hub 以共享或做版本管理dataset client.datasets(namemy_dataset) dataset.to_hub(repo_idmy_org/my_dataset)导入导出更完整的方案Python、本地磁盘、Hub 三种目标见 argilla/docs/how_to_guides/import_export.md。团队协作进阶查询、标注与 Webhook基础工作流之外官方文档还覆盖了团队协作所需的进阶能力查询与筛选argilla/docs/how_to_guides/query.md 讲解数据集查询与过滤语法可用于构建待办队列例如按response.status pending筛选未标注记录标注argilla/docs/how_to_guides/annotate.md 讲解 UI 中浏览数据集与提交响应的方式任务分配argilla/docs/how_to_guides/distribution.md 讲解基于TaskDistribution的团队自动分工机制Webhook 事件通知argilla/docs/how_to_guides/webhooks.md 与 argilla/docs/how_to_guides/webhooks_internals.md 讲解如何订阅 Argilla Server 事件如记录创建、响应提交并理解事件结构SDK 侧通过client.webhooks集合管理见 client.py富内容与多模态argilla/docs/how_to_guides/use_markdown_to_format_rich_content.md 讲解在TextField中使用 Markdown/HTML 排版对话并支持图片、音频、视频、PDF 的基本多模态展示自定义字段模板argilla/docs/how_to_guides/custom_fields.md 讲解用 HTML/CSS/JavaScript 构建CustomField布局模板。社区用 Argilla 构建了什么官方文档列举了社区基于 Argilla 构建的两类成果展示了以数据为核心理念的落地效果开源数据集与模型清理版 UltraFeedback 数据集团队用 Argilla UI 的筛选功能定位并报告了原始数据生成代码中的 bug基于该数据整理过程构建了新版本数据集并微调出 Notus 与 Notux 模型在多个基准上超过同期基线distilabel 处理后的 Intel Orca DPO 数据集结合 Argilla 中的人工整理与 distilabel 的 AI 反馈过滤掉原始数据集约 50% 的数据微调出改进版 OpenHermes 模型性能超过在原始数据集上微调的模型。这两个案例均体现了**人工反馈 AI 反馈组合清洗数据**的典型工作流。团队与流水线案例多个 AI 团队将 Argilla 用于提升 AI 项目的质量与效率AI for good红十字会领域专家与 AI 团队协作对乌克兰危机难民的求助请求进行分类与分流简化了支持流程客户支持Loris.aiAI 团队使用无监督与少样本对比学习快速验证并获取海量多标签分类器的标注样本研究调研Prolific将数据收集项目分发给标注劳动力高效收集高质量研究数据。从 Argilla 1.x 迁移到 2.x若你正在使用 Argilla 1.x 的旧版文档或数据集请注意当前仓库对应的是 2.x 系列。官方提供了专门的迁移指南 argilla/docs/how_to_guides/migrate_from_legacy_datasets.md覆盖 Users、Workspaces 与 Datasets 从 V1 到 V2 的迁移步骤。旧版1.x用户也可在仓库的 argilla-v1 子目录中找到对应源码作为参考。进一步学习路径完整实操教程argilla/docs/tutorials/index.md 提供文本分类、Token 分类、图片分类、图片偏好等 Notebook 教程可直接在 Jupyter/Colab 中运行API 参考argilla/docs/reference/argilla/client.md 与 argilla/docs/reference/argilla/datasets/datasets.md 等页面覆盖 SDK 类的全部属性、参数与方法源码研读SDK 入口与集合类实现见 argilla/src/argilla/client.pySpace 自动化部署逻辑见 argilla/src/argilla/_helpers/_deploy.pyHTTP 客户端配置见 argilla/src/argilla/_api/_client.py集成测试见 argilla/tests/integration/test_client.py服务端架构服务端FastAPI 应用、数据库模型、搜索与 Webhook位于 argilla-server 目录其配置说明见 argilla/docs/reference/argilla-server/configuration.md。综上Argilla 以数据质量为杠杆通过 Users / Workspaces / Datasets / Records 四层资源模型把 AI 工程师与领域专家组织在同一协作流程中5 分钟内即可在 Hugging Face Spaces 上完成部署并创建第一个标注数据集随后借助筛选、AI 建议、语义搜索与团队任务分配持续迭代最终把高质量标注数据导出回 Hub形成数据 → 模型 → 反馈 → 数据的完整改进闭环。【免费下载链接】argillaArgilla is a collaboration tool for AI engineers and domain experts to build high-quality datasets项目地址: https://gitcode.com/GitHub_Trending/ar/argilla创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询