Bakalářská práce

Data extraction from medical records

Tomáš Houfek
Anotace

Tato práce se zabývá extrakcí užitečných informací z lékařských zpráv. Cílem práce je schopnost automaticky vyplňovat hlášenku novotvaru pro Národní onkologický registr. Pro implementaci tohoto úkolu jsou použity dva způsoby extrakce informací. Pravidlový přístup, extrakce s pomocí regulárních výrazů a přístup hlubokého učení, konkrétně model rozpoznávání jmenných entit (Named Entity Recognition) založený …více

Abstract

This thesis focuses on automatically extracting valuable information from medical records. The specific goal of this thesis is to fill the Neoplasm incidence report from the National Oncology Registry automatically. To achieve this, two extraction approaches are used. Rule-based Regular Expression extraction and Deep-learning Medical Named Entity Recognition model based on the Transformer architecture …více

Zadání práce
Tato práce je zaměřena na vytěžování klinických dat z lékařských zpráv onkologických pacientů Masarykova onkologického ústavu (MOÚ. Lékařské zprávy jsou momentálně v částečně strukturované podobě uloženy v nemocničním informačním systému (NIS). Student bude mít k dispozici určenou množinu lékařských zpráv, se kterou bude pracovat. Specifické parametry (entity), které budou vytěžovány z lékařských zpráv jako např. TNM klasifikace, diagnóza, nebo morfologie nádoru, budou definovány ve spolupráci s odborníkem v daném oboru a na základě metodiky sběru dat do Národního onkologického registru (NOR). Získané informace budou ukládány v harmonizované podobě do definovaného formátu v souborech XML v rámci infrastruktury CERIT-SC na MU. Výsledná práce by měla nějakým způsobem popsat a uchopit problémy lékařských zpráv, např. jejich neúplnost, chyby v textu, používání různých zkratek tentýž slov různými lékaři, redundance/zdvojení diagnóz u jednoho pacienta apod. V rámci této práce student prostuduje možné způsoby vytěžování dat z částečně strukturovaného textu. Bude pracovat s nejnovějšími metodami extrakce informací, prostuduje principy transformerů pro „Named Entitity recognition“. Vytvoří vlastní množinu entit v komunikaci s odborníky a vytvoří anotovanou datovou sadu z dané části lékařských zpráv. Zorientuje se v medicínském výrazivu a implementuje vhodné techniky zpracování přirozeného jazyka a extrakce textu dle stávajícího postupu, který je využíván v rámci Úseku NOR na MOÚ. Jako kontrolu správnosti zvolených postupů porovná student přesnost extrakce jím vytěžených dat oproti ručně extrahovaným informacím pro NOR a pro projekt ADOPT. Práce má praktický přesah a v případě zdárné implementace ulehčí a zrychlí práci pracovnicím Úseku NOR MOÚ při zadávání informací do modulu parametrizované dokumentace NIS. V návaznosti na tuto práci bude parametrická dokumentace rozšiřována i v budoucnu a je pravděpodobné, že navržený algoritmus se stane součástí NIS.
Práce zkontrolována:
24. 5. 2022 21:28, Mgr. Zdenka Dudová, Ph.D., učo 211728
Jazyk práce
angličtina angličtina
Termín obhajoby
1. 7. 2022
Práce byla úspěšně obhájena

Vedoucí

Mgr. Zdenka Dudová, Ph.D., učo 211728
ANKO DITI ÚVT MU

Oponent

doc. Mgr. Bc. Vít Nováček, PhD, učo 4049
KSUZD FI MU

Konzultanti

doc. RNDr. Petr Holub, Ph.D., učo 3248
BSD DKSD ÚVT MU
doc. RNDr. Aleš Horák, Ph.D., učo 1648
KSUZD FI MU

Masarykova univerzita Fakulta informatiky
Studijní program
Informatika
Obor
  • Přidání souboru

    Soubor nebo složku lze nahrát pomocí tlačítka Přidat.
  • Další operace se soubory

    Podrobnosti lze zjistit označením příslušného řádku.
  • Pohled pro experty

    Pro častou práci je možné zvolit režim Více možností.
  • Vyhledávání souborů

    Vyhledávaný výraz můžete zadat přímo do adresního řádku.
  • Rychlý přístup k souborům

    Pomocí funkce Nedávné je možné se rychle vrátit k právě prohlíženým souborům. Oblíbené soubory je také možné označit Hvězdičkou.