Forrás: Wikimedia Commons, CC BY 2.0
A természetes nyelvfeldolgozás (NLP) egyik legérdekesebb területe a morfológiailag összetett nyelvek automatikus kezelése. A magyar az uráli nyelvcsalád egyik tagja, és agglutináló jellegéből adódóan egyetlen szótőhöz tucatnyi toldalék kapcsolódhat egymás után. Ez a tulajdonság alapvetően befolyásolja azt, ahogyan a gépi rendszerek feldolgozzák a szövegeket.
A magyar morfológia kihívásai
Egy egyszerű példán keresztül érzékelhető a különbség: az angol „in our houses" szerkezet a magyarban egyetlen szóba sűrűsödik – házainkban. Ebben a formában ott van a szótő (ház), a többes szám (-ak megváltozott formában), a birtokos személyrag (-ink) és a helyhatározórag (-ban). Egy általános célú tokenizáló, amelyet elsősorban angliai szövegekre fejlesztettek, ezt egységes lexikai egységként kezeli, és nem képes szétválasztani a grammatikai összetevőket.
Ez közvetlenül érinti a gépi fordítás, az információkinyerés és a névelem-azonosítás pontosságát. Ahol az angolban néhány szavas összetételek elégségesek, ott a magyarban az egész mondatszerkezet megváltozhat egy-egy toldalékváltással.
Agglutináló nyelv
Az agglutináló (ragozó) nyelvekben a szavak morfológiai jelentéselemeket hordozó toldalékokból épülnek fel, amelyek egymás után fűzhetők a szótőhöz. A magyar mellett ide tartozik többek között a finn, a török és a szuahéli is.
Az e-magyar infrastruktúra
A Nyelvtudományi Kutatóközpont (NYTUD) fejlesztéseként az e-magyar.hu egy moduláris feldolgozási lánc, amely a nyers szövegből kiindulva képes mondathatár-meghatározást, tokenizálást, morfológiai elemzést, egyértelműsítést (disambiguation), névelemfelismerést (NER) és mondatelemzést (dependency parsing) végezni. A rendszer Python-alapú, és nyilvánosan elérhető a fejlesztők számára.
A lánc egyik sarokköve az emMorph morfológiai elemző, amely a magyar toldalékolási szabályokat szabályalapú megközelítéssel dolgozza fel. Az emMorph kimenetét az emTag szófaji egyértelműsítő értelmezi, statisztikai modellt alkalmazva arra, hogy a kontextus alapján döntsön a lehetséges morfológiai elemzések közül.
A fenti feldolgozási sorrend azt mutatja, hogyan épülnek egymásra a modulok: a tokenizált szöveg a morfológiai elemzőn, majd a szófaji egyértelműsítőn, a névelemfelismerőn és végül a szintaktikai elemzőn megy keresztül.
HuBERT: transzformer-alapú modell magyarra
A BERT (Bidirectional Encoder Representations from Transformers) architektúra megjelenése után számos nyelvre készültek egynyelvű modellek, amelyek az adott nyelv szövegkorpuszán előtanítva finomhangolhatók különféle feladatokra. A HuBERT a NYTUD által nyilvánosan hozzáférhetővé tett, kizárólag magyar szövegeken előtanított modell.
A transzformer-alapú modellek előnye abban rejlik, hogy az előtanítás során a modell a kontextus teljes szélességét figyelembe veszi: nem csak a szótövek vagy toldalékok statisztikai előfordulása számít, hanem az is, hogy milyen kontextusban, milyen szomszédos szavak társaságában fordulnak elő. Ez a megközelítés morfológiailag gazdag nyelvek esetén is hatékony, mivel a modell implicit módon tanulja meg a toldalékolási mintázatokat.
Magyar Nemzeti Szövegtár
A nyelvi modellek betanításához és értékeléséhez referenciaalapot kínál a Magyar Nemzeti Szövegtár (MNSZ). Az MNSZ több száz millió szövegszót tartalmaz, és különféle szövegtípusokat fed le: sajtó, szépirodalmi szövegek, tudományos írások, jogi dokumentumok és internetes tartalmak egyaránt megtalálhatók benne.
Az annotált változatokban morfológiai és szintaktikai elemzések is elérhetők, amelyek lehetővé teszik, hogy a kutatók ne csak szógyakoriságokat, hanem grammatikai szerkezeteket is vizsgáljanak nagy léptékben.
Miért számít a nagy adat?
A neurális hálózatokon alapuló NLP-modellek betanításához nagy mennyiségű, lehetőleg változatos és annotált szövegadat szükséges. Kisebb, kevésbé dokumentált nyelvek esetén ez a szükséges adatmennyiség nehezebben gyűjthető össze, ami befolyásolja az elérhető modellek teljesítményét.
Összefoglalás
A magyar szöveg automatikus feldolgozása morfológiai bonyolultságából fakadóan összetettebb feladat, mint számos más európai nyelv esetén. Az e-magyar szabályalapú és statisztikai komponensei, a HuBERT kontextusérzékeny reprezentációi, valamint az MNSZ referenciabázisa együttesen azt az infrastruktúrát alkotják, amelyre a jelenlegi kutatási és fejlesztési munka épül.
Hivatkozások: e-magyar.hu · Nyelvtudományi Kutatóközpont · Magyar Nemzeti Szövegtár