返回
Infusing clinical knowledge into language models by subword optimisation and embedding initialisation
DOI:10.1016/j.compbiomed.2025.110747.png)
摘要
En 中文
• 该研究提出了一种新颖的分词方法,利用基于领域特定概念(如药物、疾病)的词元全局表示,这些概念来自UMLS等本体或任务特定语料库。
• 在训练或推理阶段,采用词和句子级别的优化来选择最优的词元表示。
• 该研究提出了针对新词元的嵌入初始化方法,消除了语言模型预训练的需求。
• 使用K-Tokeniser构建的模型在自动临床编码任务中取得了显著的Micro F1分数提升,达到13%。该模型仅需50%的训练数据用于概念提取,且在自动编码任务中仅需不到20%的数据即可超越基线临床BERT模型。
Keyword:
Tokenisation
Language model
BERT
Clinical concept and relation extraction
ICD-9 coding classification
Phenotype identification
Document classification
期刊
IF:
6.3
论文数:
8.3K
被引数:
3.3W
机构
引用论文
Multi-Modal Understanding and Generation for Medical Images and Text via Vision-Language Pre-Training通过视觉语言预训练对医学图像和文本进行多模态理解和生成
LitCovid: an open database of COVID-19 literatureLitCovid: 一个开放的新型冠状病毒肺炎文献数据库
NUCLEIC ACIDS RESEARCH
IF13.1
没有更多内容

