返回
Topic Extraction from Biographical Interviews
DOI:10.1007/978-3-032-08697-6_9.png)
摘要
En 中文
本研究旨在通过利用强大的自然语言处理(NLP)模型,为理解口述历史和传记访谈开辟一条路径。该模型旨在从德意志记忆档案(ADG)中收录的大量访谈记录中识别和提取主题。研究方法被精心划分为六个不同阶段,支撑端到端的流程。它首先进行广泛的数据预处理以确保数据质量和一致性,随后创建嵌入以将数据转换为数字形式进行进一步处理。为优化计算效率,包括关键的降维步骤。随后采用聚类技术,既用于分组相似数据,也为大量数据引入结构。部署大型语言模型(LLM)对数据进行标注,增强其可理解性和检索便捷性。最后,方法采用分类对数据施加更精细的结构。通过深入挖掘访谈对象的视角、信念和经历,本研究挖掘出访谈中隐藏的无价细微之处,并就其中讨论的各种主题或议题提出富有洞察力的观点。结果,ADG被转变为一个结构良好、直观且易于导航的资源,从而显著提升其对研究人员的价值,并使复杂的历史叙事易于探索和研究。
Keyword:
Information Extraction
Biographical Interviews
NLP
Dimension Reduction
Topic Classification
Data Archiving
Historical Narratives
Knowledge Preservation
Large Language Model
期刊
机构
暂无机构信息
引用论文
Integrating thematic analysis with cluster analysis of unstructured interview datasets: an evaluative case study of an inquiry into values and approaches to learning mathematics将主题分析与无结构化访谈数据集的聚类分析相结合:一项关于价值观和学习数学方法的探究性评估案例研究
Dimensionality reduction for visualizing single-cell data using UMAP使用UMAP实现单细胞数据可视化的降维
NATURE BIOTECHNOLOGY
IF41.7
Natural Language Processing for Automated Classification of Qualitative Data From Interviews of Patients With Cancer自然语言处理,用于自动分类来自癌症患者访谈的定性数据

