Digitalizacija muzejskih arhivov

Nove tehnologije omogočajo, da se tudi obsežne analogne muzejske zbirke v kratkem času pretvorijo v strukturirane digitalne arhive, pripravljene za iskanje, raziskovanje in dolgoročno hrambo.

Za Slovenski gledališki inštitut (SLOGI) smo v treh mesecih digitalizirali 13.000 časopisnih člankov iz obdobja med letoma 1960 in 1970 ter jih pretvorili v podatkovno zbirko z naprednimi možnostmi iskanja in filtriranja.

Proces digitalizacije je potekal v več korakih.

  1. Skeniranje analognega gradiva

Časopisne izrezke iz hemeroteke SLOGI smo digitalizirali v visokoločljive slikovne datoteke, pripravljene za nadaljnjo obdelavo.

  1. OCR prepoznavanje besedila

Z algoritmom za optično prepoznavanje znakov (OCR) smo iz slik samodejno izločili besedilo, prepoznali besedilne odstavke in ga v strukturirani obliki shranili.

  1. Z UI podprto čiščenje besedila

Na podlagi posebej razvitega UI agenta je model umetne inteligence obdelal OCR-prepoznana besedila. Popravil je značilne napake pri prepoznavi, izboljšal strukturo besedila, odstranil nepotrebne elemente ter poenotil zapise. Tako pripravljena besedila so bila primerna za nadaljnje samodejno luščenje metapodatkov.

  1. Luščenje metapodatkov

Iz očiščenega besedila smo z razvojem novega UI agenta samodejno izluščili ključne metapodatke, kot so naslov članka, leto izdaje, časopis, uprizoritev, na katero se članek nanaša, ter vrsta prispevka (kritika, članek, mnenje …).

  1. Uredniški pregled

Samodejno pripravljene podatke je pregledalo uredništvo. Kar 82 % izluščenih metapodatkov je bilo potrjenih brez vsebinskih popravkov, kar je bistveno zmanjšalo količino ročnega dela.

  1. Vzpostavitev podatkovne zbirke

Digitalizirano arhivsko gradivo smo shranili v podatkovno zbirko, ki omogoča hitro iskanje, filtriranje in pregledovanje vsebin.

  1. Samodejno povezovanje z obstoječim arhivom

Novo digitalizirano gradivo smo avtomatsko povezali z obstoječimi podatkovnimi strukturami muzejskega arhiva. Uporabniki lahko zdaj z enim iskanjem dostopajo do različnih vrst arhivskega gradiva, ne glede na to, v kateri zbirki se nahaja.

Rezultati

  • 13.000 digitaliziranih časopisnih člankov,
  • več kot 160.000 arhivskih enot v enotnem digitalnem arhivu,
  • avtomatska obdelava vseh 13.000 datotek v 3 dneh,
  • 82 % AI-pripravljenih metapodatkov potrjenih brez vsebinskih popravkov,
  • razvoj celotne digitalne rešitve v 6 mesecih.