基于 MCAP 的多模态流水线
处理可组合的视频、状态、动作、时间戳和来自多个录制系统的元数据等多模态 episode,并以 MCAP 作为 v1 输入和输出边界。
HFlow 是一款开源 SDK,用于为机器人和物理 AI 构建多模态数据质量、处理、增强与整理流水线。文档将其描述为面向生产的数据工具,可将已落地的录制转化为规范化、经过质量检查且可查询的数据集。
该项目聚焦于机器人领域的一个常见数据问题:录制内容可能包含来自多个系统的视频、状态、动作、时间戳和元数据,但团队需要一种可靠方式来验证质量、运行转换、追踪溯源并整理清单。HFlow 围绕标准 MCAP episode 提供这一完整生命周期,使用基于 Python 的处理步骤、目录支持的证据以及通过 DuckDB SQL 进行的整理。
处理可组合的视频、状态、动作、时间戳和来自多个录制系统的元数据等多模态 episode,并以 MCAP 作为 v1 输入和输出边界。
运行内置检查,或添加你自己的 Python 转换、检查、标签和增强,同时将现有处理代码保留在你自己的环境中。
通过溯源数据、架构和工具版本、可用时的源 URI,以及与步骤版本绑定的目录记录,追踪每个输出是如何生成的。
通过 Airflow DAG 将工作流渲染为图形,以便团队在计划执行期间查看任务状态、日志、重试和重新运行。
将元数据、质量证据、标签、版本标记和工件位置存储在 Parquet 目录中,以便使用 DuckDB 回答语料库级问题,而无需打开每条录制。
同时支持使用 Docker Compose 的本地单租户工作区,以及部署到现有的 Airflow 3 环境,并将数据平面与控制平面关注点分离。
在数据下游流转之前,通过检查冻结摄像头、漂移流、缺失主题或重复 episode 等问题来验证已落地的机器人录制。
通过添加转换、检查、标签和增强,将现有脚本转换为更可审计的流水线,同时保留底层 Python 代码和步骤逻辑的熟悉感。
通过查询目录、检查质量证据并编写版本固定的输出,为训练或分析创建经过整理的数据集清单,而无需加载每个 MCAP 文件。
在开发期间本地运行同一流水线,然后在 Airflow 3 环境中对其进行调度,以便周期性运行和监控。
通过沿着流水线图和目录记录追踪溯源、步骤版本和工件位置,调查结果是如何生成的。
HFlow 是一款开源 SDK,用于为机器人和物理 AI 构建多模态数据质量、处理、增强与整理流水线。它面向处理机器人或传感器录制数据并需要以结构化方式将其转化为整理后数据集的团队。
该仓库将 HFlow 描述为 pre-v1,核心生命周期已可端到端运行。它可在本地试用,项目也提示读者查看实现状态和开放问题以获取最新详情。
HFlow 从每个受支持的标准 MCAP 文件中的一个多模态 episode 开始。它可以运行转换、质量检查、标签和增强,然后写出规范化的 MCAP 输出、溯源信息、工件以及用于整理的 Parquet 目录。
开源部署可以作为单租户工作区,通过随附的 Docker Compose 运行时运行,也可以在你已管理的 Airflow 环境中,以生成的 Airflow 3 DAG 形式运行。仓库还提到提供本地快速开始和打包的快速开始。
源码文本中未在提取的页面内容里列出固定的集成目录。不过它确实提到了 Python 转换、Airflow 3 DAG 生成、用于整理的 DuckDB SQL、MCAP 格式,以及与 Foxglove 和 Rerun 等工具打开 MCAP 数据的兼容性。
ByteAsk 是面向 C 和 C++ 的终端优先 AI 编码 agent,可直接编辑仓库,并在展示 diff 前用真实编译器、调试器、sanitizers 和测试验证修改。提供免费版与付费方案。
Manta AI 是面向团队的自治式网页应用测试工具,可从 URL 自动探索应用、映射行为、捕捉回归,并用自然语言生成测试,无需脚本或维护选择器。
Mindcase 是一款 web data API 和控制台,可从网站及主流在线平台提取结构化数据。支持通过 prompt 或 API 获取清洗后的数据行,按预付费按记录计费。
CreateOS Sandbox 是基于 Firecracker 微型虚拟机的隔离计算环境,用于运行代码和 agent 工作负载,支持私有网络、SDK、CLI 和 MCP 程序化控制。
hob 是面向编码 agent 的独立工作区,可将 agent 会话、终端、历史记录和后续工作围绕你已在用的工具与提供商有序管理,适合重视本地路由、历史和工作区结构控制的开发者。
Ably Chat 是用于构建自定义实时聊天应用的 chat API 平台,支持房间消息、输入指示、在线状态、表情回应与消息更新,并提供按使用量计费选项。