Veštačka inteligencija transkribovala 32.763 srednjovekovna rukopisa za četiri meseca

Istraživači u oblasti računarske humanistike u institutu Inria objavili su kreiranje projekta CoMMA, korpusa od 32.763 srednjovekovna rukopisa koji su automatski transkribovani pomoću veštačke inteligencije. Proces transkripcije završen je za četiri meseca. Tim je za proširenje projekta koristio digitalizovane rukopisne zbirke i metapodatke objedinjene preko platforme Biblissima+.
Obrađeni rukopisi potiču iz perioda od oko 800. do 1600. godine naše ere i pisani su na srednjovekovnom latinskom, starofrancuskom i italijanskom jeziku. Za automatsko prepoznavanje teksta istraživači su primenili tehnologiju prepoznavanja rukom pisanog teksta koristeći Kraken sistem i CATMuS modele. Ukupan korpus sadrži više od 3,3 milijarde tokena.