
刘冰玉 等:基于动态主题模型融合多维数据的微博社区发现算法
247
algorithm is proposed in this paper. First, the algorithm maps microblog as a directed-weighted network, in which the direction is the
concerned relationship, and the weight is the topic’s similarity of different nodes calculated by DTM (dynamic topic model). DTM is a
microblog topic model which can not only mine the topics of each microblog accurately but also calculate author’s influence a topic.
Second, the algorithm uses label propagation WLPA (weighted lebel propagation), with low complexity, to find communities in microblog.
The initial process selects nodes with the largest influence as the initial nodes, and propagates the label in the order of node’s influences,
from large to small. The algorithm overcomes the adverse phenomenon in the traditional label propagation algorithm, and has better
stability. Experiments on real data show that the DTM model can be very good for the topic mining in microblog and DC-DTM algorithm
can effectively discover the communities of microblog.
Key words: Sina microblog; text mining; DC-DTM; Gibbs sampling; LDA; topic model
现实生活中存在多种类型的复杂网络,包括生物网络、文献引文网络以及新兴的社会网络.复杂网络具有
小世界、无标度等特点,对复杂网络的结构特征分析已经成为当前研究的热点.社交网络是一种新兴的复杂网
络,遵循复杂网络的特点,对社交网络的社区划分能够为商业推荐和用户管理以及研究工作者提供有意义的帮
助.
微博(microblog)是 Web 2.0 时代的标志性产物,是一种集成化、开放性的社交网络,是基于用户关系的信息
发布、传播以及获取的平台.作为一种新兴的社交网络平台,用户创造的不同格式(文本、图片)的数据传播到微
博网络中,不仅受到了用户的欢迎,而且也获得了很多研究人员的关注,已经成为国内外专家的研究热点.在微
博网络中,用户可以发布简短文本(通常少于 140 字)信息,此类信息称为博客(或博文),而博文信息是通过用户之
间的转发或评论等方式在网络中进行传播.作为新兴媒体,微博网络具有简便、及时等特点,受到网络用户的日
益青睐,信息涵盖的主题比传统媒体更加宽泛,有很高的更新与传播速度.对微博网络的用户关系进行分析,并
对潜在主题进行挖掘,找出兴趣相似的用户以及特定领域的活跃用户,掌握社区动态,可以为舆情控制及个性化
推荐等提供有力的支撑.
微博网络中的社区是由具有相同或相似兴趣爱好的用户组成的,可以分享并交流信息的子团体.由于微博
网络具有用户规模大、节点的度分布不均匀、弱社交网络等特点,传统的社区发现算法应用于微博网络具有局
限性,而基于概率主题模型的社区发现算法不仅适用于大规模网络,而且能够将微博网络中节点的语义信息和
微博网络拓扑结构融合,主要的概率主题模型有 LDA(latent Dirichlet allocation)
[1]
,ATM(author topic model)
[2]
等.
由于博文为短文本,存在数据稀疏性问题,本文提出 DTM(dynamic topic model)主题模型来挖掘微博网络中
的作者博文.考虑到博文的动态性,只选取作者近一年的博文作为研究对象,将不同作者博文的主题相似度作为
作者之间链接的权重,将微博网络映射为有向加权网络,并提出复杂度低的标签传播算法 WLPA(weighted lebel
propagation)进行社区发现.通过在新浪微博数据上进行实验,结果表明:本文所提出的主题模型 DTM 与 LDA 模
型相比,模型的困惑度较低,并且该模型能够较为准确地定位对某一话题敏感的作者集合;本文所提出的
DC-DTM 社区发现算法发现的社区的模块度较高.
本文的主要贡献如下:(1) 根据微博网络中节点自身以及节点之间联系的特性,建立微博网络的 RT 模型,
将微博网络映射为有向加权网络;(2) 利用 DTM 概率模型,将转发/评论博文与原博文相结合,挖掘作者的主题
分布以及整个网络的主题分布趋势;(3) 将不同作者的主题分布相似度作为作者之间联系的权重,在此基础上
利用标签传播算法对微博网络进行重叠社区发现;(4) 针对微博网络的社区发现,提出了基于语义的微博网络
社区的评价指标;(5) 在大量新浪微博数据中进行实验,实验结果表明本文所提出的 DTM 模型在生成主题质
量、内容困惑度以及模型复杂度等方面的指标都优于传统 LDA 模型,本文的 DC-DTM 算法发现的社区比传统
的基于标签的社区发现算法的模块度高,稳定性好.
1 相关工作
目前研究者已经提出了许多社区发现算法,从传统的根据网络拓扑结构进行社区发现发展到基于语义的
社区发现以及融合拓扑结构和语义的社区发现算法.下面分别对这 3 类算法进行阐述.
评论