Darba nosaukums: Ventspils valstspilsētas pašvaldības kapsētu datu digitalizācija
Darba autors: Linda Celma
Darba vadītājs: Ph. D. Linda Gulbe-Viļuma
Darba apjoms: 55 lpp., 2 tabulas, 21 attēls, 38 bibliogrāfiskās norādes, 1
pielikums.
Atslēgas vārdi: OCR, KRAKEN OCR, DOKUMENTU DIGITALIZĀCIJA,
TEKSTA ATPAZĪŠANA, PRIEKŠAPSTRĀDE
Šajā darbā tiek pētīta Ventspils valstspilsētas kapsētu grāmatu digitalizācija,
izmantojot optiskās rakstzīmju atpazīšanas (OCR) tehnoloģijas. Bakalaura darba mērķis ir
izpētīt brīvi pieejamos neironu tīklu risinājumus rokrakstu atpazīšanai un izstrādāt
risinājumu ieskenētu kapsētu dokumentu vizuālās kvalitātes uzlabošanai (priekšapstrādei)
un automatizētai teksta atpazīšanai.
Pētījuma laikā tika analizētas dažādas attēlu priekšapstrādes metodes un vairāki
OCR rīki, secinot, ka visprecīzākos rezultātus nodrošina Kraken OCR sistēma. Tika
izveidota apmācības datu kopa ar 392 paraugiem un veikta Kraken OCR modeļa apmācība,
testēšana un validācija. Validācijas laikā tika analizēta teksta lokalizācijas un rakstzīmju
atpazīšanas precizitāte, izmantojot rakstzīmju kļūdu līmeņa (CER) metriku. Rezultāti
parādīja, ka teksta lokalizācija tiek veikta ar augstu precizitāti, taču rakstzīmju precizitātes
uzlabošanai būtu nepieciešami vēl papildu pētījumi.
Abstract (english):
Title of the Paper: Digitalization of Ventspils State City Municipality cemetery
data
Author: Linda Celma
Supervisor: Ph. D. Linda Gulbe-Viļuma
Length of the Paper: 55 pages, 2 tables, 21 figures, 38 bibliographic references, 1
attachment.
Keywords: OCR, KRAKEN OCR, DOCUMENT DIGITIZATION, TEXT
RECOGNITION, PREPROCESSING
This thesis investigates the digitization of cemetery records of the state city of
Ventspils using Optical Character Recognition (OCR) technologies. The aim of the
bachelor’s thesis is to explore freely available neural network solutions for handwritten text
recognition and to develop a solution for improving the visual quality (preprocessing) of
scanned cemetery documents and for automated text recognition.
During the research, various image preprocessing methods and several OCR tools
were analyzed, leading to the conclusion that the Kraken OCR system provides the most
accurate results. A training dataset containing 392 samples was created, and the Kraken OCR
model was trained, tested, and validated. During validation, the accuracy of text localization
and character recognition was analyzed using the Character Error Rate (CER) metric. The
results showed that text localization can be performed with high accuracy; however,
additional research would be required to further improve character recognition accuracy.
This work is protected by copyright and/or neighboring rights. It can be freely used for personal use, scientific research, or self-education. Other uses require permission from the right holder(s).
APLIS statement of rights:
Protected by copyrights - not in commercial circulation
APLIS access notice:
Accessible online (without the ability to download)