Unknown

Dataset Information

0

Domain and Language adaptive pre-training of BERT models for Korean-English bilingual clinical text analysis.


ABSTRACT:

SUBMITTER: Jo E 

PROVIDER: S-EPMC12648908 | biostudies-literature | 2025 Nov

REPOSITORIES: biostudies-literature

altmetric image

Publications

Domain and Language adaptive pre-training of BERT models for Korean-English bilingual clinical text analysis.

Jo Eunbeen E   Cho Eunbi E   Lee Yebin Y   Song Sanghoun S   Joo Hyung Joon HJ  

BMC medical informatics and decision making 20251125 1


OBJECTIVE: To develop bilingual Korean-English medical language models through domain- and language-adaptive pre-training and evaluate their performance in clinical text analysis tasks, specifically semantic similarity and multi-label classification. METHODS: A bilingual corpus comprising Korean (medical textbooks and online health articles) and English (medical textbooks, health-related articles, and MIMIC-IV EHRs) clinical texts were constructed. Three BERT-based foundation models (Korea Medic  ...[more]

Similar Datasets

| S-EPMC4753071 | biostudies-literature
| S-EPMC10516340 | biostudies-literature
| S-EPMC4318278 | biostudies-literature
| S-EPMC12497596 | biostudies-literature
| S-EPMC12635123 | biostudies-literature
| S-EPMC9132055 | biostudies-literature