Nove tehnologije omogočajo, da se tudi obsežne analogne muzejske zbirke v kratkem času pretvorijo v strukturirane digitalne arhive, pripravljene za iskanje, raziskovanje in dolgoročno hrambo.
Za Slovenski gledališki inštitut (SLOGI) smo v treh mesecih digitalizirali 13.000 časopisnih člankov iz obdobja med letoma 1960 in 1970 ter jih pretvorili v podatkovno zbirko z naprednimi možnostmi iskanja in filtriranja.
Proces digitalizacije je potekal v več korakih.
- Skeniranje analognega gradiva
Časopisne izrezke iz hemeroteke SLOGI smo digitalizirali v visokoločljive slikovne datoteke, pripravljene za nadaljnjo obdelavo.
- OCR prepoznavanje besedila
Z algoritmom za optično prepoznavanje znakov (OCR) smo iz slik samodejno izločili besedilo, prepoznali besedilne odstavke in ga v strukturirani obliki shranili.
- Z UI podprto čiščenje besedila
Na podlagi posebej razvitega UI agenta je model umetne inteligence obdelal OCR-prepoznana besedila. Popravil je značilne napake pri prepoznavi, izboljšal strukturo besedila, odstranil nepotrebne elemente ter poenotil zapise. Tako pripravljena besedila so bila primerna za nadaljnje samodejno luščenje metapodatkov.
- Luščenje metapodatkov
Iz očiščenega besedila smo z razvojem novega UI agenta samodejno izluščili ključne metapodatke, kot so naslov članka, leto izdaje, časopis, uprizoritev, na katero se članek nanaša, ter vrsta prispevka (kritika, članek, mnenje …).
- Uredniški pregled
Samodejno pripravljene podatke je pregledalo uredništvo. Kar 82 % izluščenih metapodatkov je bilo potrjenih brez vsebinskih popravkov, kar je bistveno zmanjšalo količino ročnega dela.
- Vzpostavitev podatkovne zbirke
Digitalizirano arhivsko gradivo smo shranili v podatkovno zbirko, ki omogoča hitro iskanje, filtriranje in pregledovanje vsebin.
- Samodejno povezovanje z obstoječim arhivom

Novo digitalizirano gradivo smo avtomatsko povezali z obstoječimi podatkovnimi strukturami muzejskega arhiva. Uporabniki lahko zdaj z enim iskanjem dostopajo do različnih vrst arhivskega gradiva, ne glede na to, v kateri zbirki se nahaja.
Rezultati
- 13.000 digitaliziranih časopisnih člankov,
- več kot 160.000 arhivskih enot v enotnem digitalnem arhivu,
- avtomatska obdelava vseh 13.000 datotek v 3 dneh,
- 82 % AI-pripravljenih metapodatkov potrjenih brez vsebinskih popravkov,
- razvoj celotne digitalne rešitve v 6 mesecih.