话题模型(topic models),理学-计算机科学技术-人工智能-机器学习-贝叶斯学习,用来描述和建模一系列文档的一类统计隐含变量模型。话题模型被大量用于大规模文档的可视化,摘要以及浏览。话题模型的基本假设是每篇文档都有几个主题构成。其中每个主题都是由不同的词汇来代表。这个代表是由每个词汇都有不同的概率权重来实现的。代表某个主题的词汇通常都会同时出现在一篇文档来表达这个主题。比如,一篇介绍健康的文章可能会包括饮食和运动两个主题。其中饮食的主题常常会包含关键词“蔬菜”和“水果”,因为这两个词经常出现在一起来代表健康饮食。其中运动的主题则可能会包含关键词“跑步”和“散步”,因为这两个词也会经常一起出现在关于运动与健康的文档里。通过处理大量的文档数据,话题模型可以自动发现不同的词与词的共生关系,然后把他们归到同一个主题里面。通过查看每个主题里面不同词的概率权重,就可以知道每个主题的主要含义是什么。而每个文档就可以表述为一个权重向量,其中每个权重代表相应主题的重要性。这个权重向量经常都是稀疏的,因为虽然可能的主题会有很多个,但出现在一篇文章里的主题数目通常都有限。