暂无图片
暂无图片
暂无图片
暂无图片
暂无图片

竞赛人五一作业:4篇多模态BERT论文

Coggle数据科学 2022-02-16
360

VideoBERT

视频和语言表征的联合学习模型

https://arxiv.org/pdf/1904.01766.pdf

视频+文本
:将从视频数据编码为token,将文本结果编码为token,然后在这些token 的序列上学习双向联合分布。

VisualBERT

https://arxiv.org/pdf/1908.03557.pdf

图像+文本
:将图像目标检测的结果编码为token,将文本编码为token,然后完成联合建模。

SpeechBERT

https://arxiv.org/pdf/1910.11559.pdf

语音+文本
:将语音数据编码为token,将文本编码为token,然后完成联合建模。

LayoutLM

https://arxiv.org/pdf/1912.13318.pdf

OCR检测结果+文本
:将文本的位置信息进行编码,将文本编码为token,然后完成联合建模。


竞赛交流群已成立
学习数据竞赛,组队参赛
添加👇微信拉你进群
加入了之前的社群不需要重复添加~

文章转载自Coggle数据科学,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。

评论