酷应用

李飞飞团队将ViT用在机器人身上，规划推理最高提速512倍，还cue了何恺明的MAE

百家作者：量子位 2022-06-25 20:07:00

杨净发自凹非寺
量子位 | 公众号 QbitAI

人类的预测能力+ViT，会产生什么样的化学反应？

会让机器人的行动规划能力又快又准。

这是李飞飞团队的最新研究——MaskViT，通过MVM，掩码视觉建模对Transformer进行预训练，从而建立视频预测模型。

结果显示，MaskViT不仅能生成256*256视频，还可以让机器人行动规划的推理速度最高提高了512倍。

来看看这是项什么样的研究？

从人类身上找灵感

神经科学领域的研究表明，人类的认知、感知能力是有一种预测机制来支持的。

这种对世界的预测模型，可以用来模拟、评估和选择不同的可能行动。

对人类来说，这一过程是快速和准确的。

如果能赋予机器人类似的预测能力。那么他们就可以在复杂的动态环境中快速规划、执行各类任务。

比如，通过视觉模型来预测控制，也许就是一种方式，但也对算力和准确性提出了更高的要求。

于是，李飞飞团队就想到了最近诸多进展的ViT架构，以及以何恺明MAE为代表的基于MVM，Masked Visual Modeling这一自监督预训练表征。

但具体要操作起来，仍有不少的技术挑战。

一方面，全局注意力机制的复杂度与输入序列长度的平方呈正比，导致视频处理成本过高。

另一方面，视频预测任务和自回归掩码视觉预训练之间存在不一致。实际测试时，模型必须从头预测完整的未来帧序列，导致视频预测质量不好。

基于这样的背景，李飞飞团队提出了MaskViT——通过掩码视觉建模对Transformer进行预训练，从而建立视频预测模型。

具体有两种设计决策。

首先，为了提高记忆和训练效率，使用了两种类型的窗口注意力：空间注意力和时空注意力。

其次，训练过程中掩码的token比例是可变的。

在推理阶段，视频是通过迭代细化生成的，其中按照掩码调度函数逐步降低掩码率。

实验结果

研究团队在三个不同数据集，以及四个不同指标来评估了MaskViT。

结果显示，跟以往先进的方法比较，MaskViT都表现出了更好的性能，可生成分辨率达256 × 256的视频。

还在BAIR进行了消融实验。

随后，团队还展示了真实机器人使用MaskViT进行实时规划的效果。

推理速度最高可提升512倍。

研究人员表示，本次工作表明，可以通过最小的领域知识，利用掩码视觉建模的一般框架，赋予像智能体强大的预测模型。

但同时表示，也具有一定的局限性。

比如在每帧量化时会出现闪烁伪影，尤其是在RoboNet这种有静态背景的视频中。

还有如果要扩大视频预测的规模，也仍然具有挑战性，特别是那种有大量摄像机运动的场景。

未来，他们将探索把这一视频预测方法整合到更复杂的规划算法中。

值得一提的是，在今年5月，何恺明团队曾提出过视频版MAE，并发现最佳掩蔽率高达 90%。

论文链接：
https://arxiv.org/abs/2206.11894
项目链接：
https://maskedvit.github.io/
何恺明论文：
https://arxiv.org/abs/2205.09113

— 完 —

「人工智能」、「智能汽车」微信社群邀你加入！

欢迎关注人工智能、智能汽车的小伙伴们加入我们，与AI从业者交流、切磋，不错过最新行业发展&技术进展。

ps.加好友请务必备注您的姓名-公司-职位哦~

点这里

关注公众号：拾黑（shiheibook）了解更多

[广告]赞助链接：

四季很好，只要有你，文娱排行榜：https://www.yaopaiming.com/
让资讯触达的更精准有趣：https://www.0xu.cn/

*文章为作者独立观点，不代表爱尖刀立场

本文由量子位发表，转载此文章须经作者同意，并请附上出处( 爱尖刀 )及本页链接。

原文链接 https://www.ijiandao.com/2b/baijia/434669.html

李飞飞

图库

张大萌Poyee“用进步解决所有攻击好啦”

左点儿儿竟然还把我最爱的露思老婆印在罐子上了！！ - 小红书

兮兮夏天什么时候过去了，我都没注意？ - 小红书

朴珪瑛怎么读你是特别的存在

小何同学yo亲爱的，你已经走了这么远，努力了那么久

Brandy Gordon看看她的时尚穿搭，那真是引领潮流！

量子位

关注网络尖刀微信公众号
随时掌握互联网精彩

赞助链接

百度热搜榜

排名热点搜索指数

1 习近平将发表二〇二六年新年贺词 7904141

2 2026年国补政策来了 7808738

3 东部战区：开火！开火！全部命中！ 7712893

4 2026年这些民生政策将惠及百姓 7616985

5 小学食堂米线过期2.5小时被罚5万 7519709

6 解放军喊话驱离台军原声曝光 7428214

7 为博流量直播踩烈士陵墓？绝不姑息 7327605

8 每月最高800元！多地发放养老消费券 7238391

9 数字人民币升级 1月1日起将计付利息 7141831

10 2026年1月1日起一批新规将施行 7040675

李飞飞团队将ViT用在机器人身上，规划推理最高提速512倍，还cue了何恺明的MAE

杨净 发自 凹非寺量子位 | 公众号 QbitAI

从人类身上找灵感

实验结果

杨净发自凹非寺
量子位 | 公众号 QbitAI