#今日论文推荐#Multi-modal Multi-task Masked Autoencoder:一种简单、灵活且有效的 ViT 预训练策略
·
#今日论文推荐#Multi-modal Multi-task Masked Autoencoder:一种简单、灵活且有效的 ViT 预训练策略
本文介绍了一种简单、灵活且有效的Vit预训练策略。
MAE是一种使用自监督预训练策略的ViT,通过遮蔽输入图像中的补丁,然后预测缺失区域进行子监督与训练。尽管该方法既简单又有效,但 MAE 预训练目标目前仅限于单一模态——RGB 图像——限制了在通常呈现多模态信息的实际场景中的应用和性能。
在新论文 MultiMAE: Multi-modal Multi-task Masked Autoencoders 中,来自瑞士洛桑联邦理工学院 (EPFL) 的团队提出了 Multi-modal Multi-task Masked Autoencoders (MultiMAE),也是一种预训练策略,可以对掩码进行自动编码处理并执行多模态和多任务的训练。MultiMAE 使用伪标签进行训练,使该框架适用于任何 RGB 数据集。
论文题目:MultiMAE: Multi-modal Multi-task Masked Autoencoders
详细解读:https://www.aminer.cn/research_report/627dbe7b7cb68b460fb6cd8e?download=false
https://www.aminer.cn/research_report/627dbe7b7cb68b460fb6cd8e?download=false
AMiner链接:https://www.aminer.cn/?f=cs
更多推荐
所有评论(0)