Bertopic技术路线图 国自然基金论文,该流程图分为数据处理、主题建模、可视化三大模块,完整呈现一套文本主题挖掘分析的技术流程。在数据处理模块,原始文本先开展数据清洗,导入自定义词库,利用 Jieba 完成分词预处理,再结合停词库做停用词过滤;处理之后的文本送入 Embeddings 文档嵌入环节,可选用 bge、snowflake、gte、mpnet、MiniLM 多种嵌入模型生成文本向量。进入主题建模模块,得到文档向量后先经由 UMAP 实施降维,再使用 HDBSCAN 算法做聚类;聚类结果经过 CountVectorizer 实现词向量化,借助 c‑TF‑IDF 完成关键词提取;之后开展 Representation Fine‑tuning 主题表示优化,输出优化后的主题结果。后续进入可视化模块,首先分析主题演化趋势,再统计主题词分布;接着执行分层聚类,绘制主题间距离图;调用 LLM 完成领域化主题描述,最终实现文档主题可视化输出。整套方案融合多种文本嵌入模型、降维聚类算法以及大语言模型,完成从原始文本预处理、无监督主题挖掘再到多维度可视化的全链路文本分析工作流,可用于中文文本的主题识别与演化分析。无论做文本挖掘方向的毕业论文学生,还是开展社科文本分析的科研人员都可以作为流程参考。
提示: 本内容由社区用户上传并分享。平台不对内容的真实性、合法性、知识产权归属及是否侵害第三方权利进行事前审核或保证。本内容可能包含受版权保护的图片、字体或其他第三方素材,使用前请自行确认授权范围。