VideoBERT
视频和语言表征的联合学习模型
https://arxiv.org/pdf/1904.01766.pdf
视频+文本
:将从视频数据编码为token,将文本结果编码为token,然后在这些token 的序列上学习双向联合分布。

VisualBERT
https://arxiv.org/pdf/1908.03557.pdf
图像+文本
:将图像目标检测的结果编码为token,将文本编码为token,然后完成联合建模。

SpeechBERT
https://arxiv.org/pdf/1910.11559.pdf
语音+文本
:将语音数据编码为token,将文本编码为token,然后完成联合建模。

LayoutLM
https://arxiv.org/pdf/1912.13318.pdf
OCR检测结果+文本
:将文本的位置信息进行编码,将文本编码为token,然后完成联合建模。



文章转载自Coggle数据科学,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。




