机器人前瞻(公众号:robot_pro)
作者 | 周加琦
编辑 | 漠影

机器人前瞻8月26日报道,今天凌晨,Figure CEO Brett Adcock在X上宣布,今天正式推出Index——全球规模最大且最多样化的机器人数据集。

Figure正式发布Index:覆盖108个国家和地区,超1600万段视频

▲(图源:X)

目前,Index包含超1600万段视频,覆盖家庭、物流、餐饮、工业等室内外多类任务场景。素材全部来自真实场景第一视角录制,还原真实工作流程,并配套自动化与人工协同的数据处理管线,完成从过滤到标注。

Figure称,迄今为止,他们已经在108个国家和地区收集了数据、累计下载量达26.4万次,并拥有超过4.4万名周活跃用户。

不仅如此,Figure还表示,已经向数据创作者支付了1500万美元,并承诺在未来12个月内,在数据和算力方面投入超过10亿美元

评论区有网友称,终于看到机器人领域有实打实的进展了。

Figure正式发布Index:覆盖108个国家和地区,超1600万段视频 ▲(图源:X)

一、覆盖108个国家和地区,累计下载26.4万次

四个月前,Figure曾秘密推出一款APP用于测试,希望能直接从人类这里收集大规模的真实物理世界数据。

今天,这个APP被重新命名为Index,并已经在Google Play和App Store上正式发布。

Figure正式发布Index:覆盖108个国家和地区,超1600万段视频

▲Index(图源:Figure)

在此之前,Figure也尝试购买数据,但其称,供应商提供的数据无法达到Helix模型所需要的吞吐量、多样性和质量标准。因此,Figure选择自己构建整个数据采集系统。

在Index平台,创作者可以录制自己日常做家务或工作的视频,也可以通过平台雇佣零工上门完成家务,同时录制第一视角操作画面,来获取奖励。

目前,Index已经应用在108个国家和地区,累计下载量超26.4万次每周有4.4万名用户活跃。在速度上,该应用实现每秒处理30分钟的视频上传量。

Figure正式发布Index:覆盖108个国家和地区,超1600万段视频

▲周用户活跃量(图源:Figure)

Figure称,每一位新的创作者都可能带来此前未出现过的环境、物体,以及他们独特的任务完成方式。Index已经涵盖了各种人类任务,烹饪、清洁、洗衣服等各类家务;物流中心、工厂、办公室等各类企业内部任务。

Figure正式发布Index:覆盖108个国家和地区,超1600万段视频

▲采集种类(图源:Figure)

在每采集1000小时的数据中,Index平均包含373种独特的任务1146种被操作的对象116个独特的环境。目前,Figure已经向创作者支付1500万美元

二、24小时不间断处理,五大环节保证数据质量

Index要处理全球创作者每秒30分钟的视频数据,因此Figure构建了整套数据基础设施,该设施实现7*24小时稳定运行、持续的大规模计算处理能力,以及可实时向创作者反馈,不断优化后续数据采集质量。

整套数据管线主要分为五大环节:

自动过滤:从视频技术、画面画质、内容语义三个维度进行初筛。

人工复核:审核人员会抽查上传样本,排查是否有违规的上传行为。

数据去重:相似度超出阈值的素材直接被剔除,以此保障数据多样性。

样本均衡:依据视频与任务场景的匹配程度,按预设配额分配各任务素材总量;通过特征聚类区分视频细微动作与场景,补齐标签遗漏的样本。

分层标注:为每一段完整行为视频生成层级化文本描述标签。

Figure称,Index正在为“机器人即服务”的规模化落地打基础。未来,这些事情将由机器人替人们完成。

结语:行业的竞争,正在进入“数据战”

对于整个具身智能行业而言,真实且多样的物理世界数据一直是稀缺资源。Figure此次推出Index,本质上是在尝试把分散在人类日常生活和工作中的真实行为,转化为可用于训练机器人的“数据燃料”。

从“买数据”转向“自己造数据”,再到未来12个月投入超过10亿美元,Figure押注的已经不只是一个数据集,而是一套能够持续获取、处理和生产机器人训练数据的基础设施。

当机器人开始从“能动”走向“会干活”,数据正在成为继本体、模型和算力之后,新的核心竞争力。