NLP erőforrások - meetup prezentációk

2015.04.29. 20:52 Szerző: Zoltán Varjú Címkék: prezentáció korpuszok NLP meetup NLP erőforrások

NLP erőforrások meetupunk prezentációit alább közöljük. Köszönet az előadóknak és mindenkinek aki eljött! Miháltz Mártonnak külön köszönet az ötletért, szervezésért és lebonyolításért!

FELHÍVÁS

Vincze Veronika: A Szeged Korpusz és Treebank

Vincze Veronika: Korpuszok az információkinyerésben

Sass Bálint: 28 millió szintaktikailag elemzett mondat és 500000 igei szerkezet

Miháltz Márton: Magyar WordNet

Ács Judit: Online soknyelvű szótárak

Simon Eszter: Silver standard korpuszok tulajdonnév-felismeréshez

A Kereső Világ a Precognox szakmai blogja A Precognox intelligens, nyelvészeti alapokra építő keresési, szövegbányászati és big data megoldások fejlesztője.

Facebook Tweet

Szólj hozzá! • Kövess Facebookon • Iratkozz fel értesítőre

Textus; szövegek hálójában

2015.04.23. 18:30 Szerző: Zoltán Varjú Címkék: meetup politikai blogok tartalomelemzés hálózatelemzés

Mai MeetOFF előadásom diái.

A Kereső Világ a Precognox szakmai blogja A Precognox intelligens, nyelvészeti alapokra építő keresési, szövegbányászati és big data megoldások fejlesztője.

Facebook Tweet

Szólj hozzá! • Kövess Facebookon • Iratkozz fel értesítőre

NLP erőforrások az áprilisi meetupon

2015.04.22. 12:49 Szerző: Zoltán Varjú Címkék: meetup korpuszok NLP meetup

Április 29-én tartjuk meetupunkat, 18 órától a megszokott helyen a Colabs-ben. Rövid, ötperces előadások keretében mindenki megismerheti a magyar korpuszokat. Érdemes eljönni, mert egyrészt tök jó előadások lesznek, másrészt meg továbbra is ingyenes a rendezvény, de regelni azért nem árt a meetup.com-on itt, vagy Facebookon itt.

Vincze Veronika (MTA-SZTE Mesterséges Intelligencia Kutatócsoport)

A Szeged Korpusz és Treebank

Az előadásban bemutatjuk a Szeged Korpusz és Treebank nevű adatbázist, mely a maga 1,2 millió szavával a legnagyobb, teljes egészében kézzel annotált, magyar nyelvű szövegkorpusz. A korpusz hét különböző doménből származó szövegeket foglal magában, ezek számos annotációs réteggel rendelkeznek: megtalálható bennük az egyes szövegszavak összes lehetséges, illetve a kontextusnak megfelelő morfológiai kódja, minden egyes mondathoz hozzá van rendelve annak szintaktikai szerkezete kétféle elméleti keret szerint is, továbbá szemantikai jellegű annotációk is találhatók egyes részkorpuszokban.

Korpuszok az információkinyerésben

A szövegekben található információk hatékony kinyeréséhez számos nyelvi jelenséget tudnunk kell kezelni, mint például tulajdonnevek és névelemek, többszavas kifejezések, nyelvi bizonytalanság és szubjektivitás. Az előadásban bemutatjuk azokat a Szegeden készült korpuszokat, amelyek különböző doménekből és nyelvekből származó szövegeket tartalmaznak, és bennük nyelvész szakértők kézzel megjelölték az előbb említett jelenségeket, így tanító és tesztadatbázisként szolgálhatnak az információkinyerő rendszerek különböző moduljaihoz.

Sass Bálint (MTA Nyelvtudományi Intézet, Nyelvtechnológiai Kutatócsoport)

28 millió szintaktikailag elemzett mondat és 500000 igei szerkezet

Mondataink jelentős része úgy épül fel, hogy egy központi ige körül rendeződnek el az ige különféle bővítményei. Pl.:elrendeződik + mi? bővítmény + mi körül? ige körül. Az ilyen „mondatvázakat'' nevezzük igei szerkezeteknek, tartalmazzanak vonzatot (hisz vmiben), konkrét szókapcsolatot (döntés születik) vagy akár a kettő kombinációját (igényt tart vmire). Az előadás egy nyelvi erőforrást mutat be: magyar igei szerkezetek korpuszból automatikusan kinyert igen jelentős méretű gyűjteményét. Ez a gyűjtemény információt ad az igék és a bővítmények szokásos viselkedéséről, tulajdonságairól, a szelekciós preferenciákról, így hasznos lehet magyar nyelvű szöveg tartalmi, szemantikai feldolgozása során. A fentit egészíti ki egy másik erőforrás: a 28 millió sekély elemzéssel ellátott tagmondatból álló korpusz, melyből az igei szerkezetek származnak. Kutatási célra szabadon, üzleti célra egyedi megállapodás keretében férhetők hozzá.

Miháltz Márton (MTA Nyelvtudományi Intézet, Nyelvtechnológiai Kutatócsoport)

Magyar WordNet

A Magyar WordNet (HuWN) a Princeton WordNet elveit követve a nyelvi fogalmakat szinonimahalmazokkal (synsetekkel) reprezentálja és közöttük szemantikai viszonyokat definiálva (pl. hipernima (is-a), meronima (rész-egész), antonima stb.) hoz létre egy lexikális fogalmi hálózatot. Noha a wordnetekben a nyelvi fogalmak közötti taxonómia nem felel meg egy szigorú formális ontológia követelményeinek, az NLP különböző alkalmazásaiban mégis gyakran használják őket világismereti reprezentáció forrásaként. A Magyar WordNet 42 ezer synsetet tartalmaz, és össze van kapcsolva az angol (Princeton) WordNet 2.0-ás és 3.0-s verzióival, ami átjárást biztosít több mint 20 egyéb nyelv wordnetjeihez, illetve az angol wordnethez illeszkedő egyéb adatbázisokhoz (Yago, DBPedia, BabelNet stb.). A HuWN szabadon hozzáférhető.

Ács Judit (MTA Nyelvtudományi Intézet, Matematikai Nyelvészeti Kutatócsoport)

Online soknyelvű szótárak

A kétnyelvű szótárak fontos építőelemei számos NLP alkalmazásnak, azonban előállításuk rendkívül idő- és pénzigényes, ezért az automatikus szótárépítés egyre nagyobb szerepet kap. Bemutatunk egy nyelvfüggetlen módszert, amelynek segítségével a Wiktionaryből kiindulva 53 nyelven összesen 1378 szótárat készült, köztük valószínüleg az első, gép által is olvasható magyar-vietnámi szótár.

Simon Eszter (MTA Nyelvtudományi Intézet, Nyelvtechnológiai Kutatócsoport)

Silver standard korpuszok tulajdonnév-felismeréshez

A felügyelt gépi tanulási módszerek alkalmazásához nagyméretű annotált korpuszokra van szükség, amelyek előállítása rendkívül emberierőforrás-igényes. Több lehetőség van az annotációs költségek csökkentésére, ezek közül az egyik az automatikus annotálás. Az előadásban egy olyan nyelvfüggetlen módszert mutatunk be, mellyel bármely Wikipédiával rendelkező nyelvre előállítható tulajdonnévi címkéket tartalmazó korpusz. Az automatikus annotálás során a DBpedia ontológiai kategóriáit képeztük le CoNLL-névosztályokra. Az így előállított magyar és angol nyelvű korpuszok ugyan silver standard korpuszok, de a kiértékelésünk alapján hasonlóan jól használhatók felügyelt névfelismerő rendszerek tanításához és kiértékeléséhez, mint a gold standard korpuszok.

A Kereső Világ a Precognox szakmai blogja A Precognox intelligens, nyelvészeti alapokra építő keresési, szövegbányászati és big data megoldások fejlesztője.

Facebook Tweet

Szólj hozzá! • Kövess Facebookon • Iratkozz fel értesítőre

Politikai blogokkal foglalkozó projektünk a Media Hungary-n

2015.04.20. 08:19 Szerző: Zoltán Varjú Címkék: konferencia politikai blogok Media Hungary

Május 12. és 13. között kerül megrendezésre az idei Media Hungary, amin bemutatjuk politikai blogokkal foglalkozó projektünket.

Kontextus és a hivatkozások ereje című előadásunk a második napon, a Tartalommarketing szekcióban 15:15-kor kezdődik és kb. az alábbiakról fogunk beszélni:

Hogyan hivatkoznak egymásra a profi szerzők és a webkettes tartalomgyártók? Kik tematizálják az online világot? A Nyelv és Tudománnyal indított projektünk keretében egy hetven blogot tartalmazó listát használva több mint tizenkétezer magyar nyelvű egyedi oldalt gyűjtöttünk be, s ezek között több mint huszonkétezer linket találtunk. Adatainkra alapozva megvizsgáltuk a közéleti szféra topológiáját, azaz hogy kik a legbefolyásosabb szereplők, kiken keresztül áramlik a legtöbb információ, kik linkelnek a leglelkesebben, kik kapják a legtöbb linket. A hagyományos hálózati elemzést szöveganalitikai megoldásokkal ötvözve megvizsgáljuk milyen témák jelennek meg a hálózaton s hogyan terjednek azok térben és időben. Végezetül kitérünk arra is, hogy milyen érzelmek kapcsolódnak az egyes témákhoz és milyen érzelmek kísérik az egyes hivatkozásokat.

A Kereső Világ a Precognox szakmai blogja A Precognox intelligens, nyelvészeti alapokra építő keresési, szövegbányászati és big data megoldások fejlesztője.

Facebook Tweet

Szólj hozzá! • Kövess Facebookon • Iratkozz fel értesítőre

Olvasni jó? MeetOFF április 23-án

2015.04.16. 08:46 Szerző: Zoltán Varjú Címkék: meetup politikai blogok meetoff

Április 23-án a MeetOFF Olvasni jó? - Olvasás a 21. században meetupján adok elő. A rendezvényre itt lehet regisztrálni, a belépő 1000 HUF PayPalon fizetve, 1500 a helyszínen. A meetupon főleg könyvekről és az olvasásról hallhattok majd, én politikai blogos projektünkről fogok beszélni.

“Az elektronikus hálózat révén az emberek teljesen bevonódnak egymás életébe. Közvetlenül és szakadatlan ömlik ránk az információ, melyet alighogy feldolgoztunk, máris követ az új, aztán még újabb adag.Elektronikussá alakított világunk arra sarkall bennünket, hogy kategorizáló szokásunkat mintázatfelismerő eljárásra cseréljük.” McLuhan már 1967-ben felhívta a figyelmet arra, hogy elárasztanak minket az információk, pedig akkor még nem voltak se blogok, se híroldalak, se közösségi média. Az, hogy az olvasó szelektálja mit olvas, s ez a szelekció mintegy burokba zárja őt, egyre ismertebb. Minket az érdekel hogy a tartalmak előállítói is saját világukban élnek-e? Kikre hivatkoznak a hírek szerzői és a politikai blogok véleményvezérei? Van-e átjárás a megannyi politkai nézetet valló szerző között? Hatnak-e egymásra azok, akik a közvéleményt formálják?
A Nyelv és Tudománnyal elindított projektünk során 12 121 posztot/cikket gyűjtöttünk be. Vizsgálataink során a klasszikus linkelemzést (pl. PageRank, be- és kimenő élek száma, stb.) szeretnénk a tartalomelemzés módszereivel ötvözni, s olyan kérdésekre megtalálni a választ mint:

milyen témák foglalkoztatják a híroldalakat és blogokat
honnét indul el egy-egy téma
hogyan terjed egy téma
milyen érzelmek tapadnak egy témához

A Kereső Világ a Precognox szakmai blogja A Precognox intelligens, nyelvészeti alapokra építő keresési, szövegbányászati és big data megoldások fejlesztője.

Facebook Tweet

HTML

Precognox

Precognox Blogkereső

opendata.hu

Facebook oldaldoboz

Blog figyelése (RSS)

Érdekes oldalak

Star Wars text mining

Főbb témák

Archívum

Belépés

A blog tartalmai CC licenc alá tartoznak

Big Data - Keresés - Számítógépes nyelvészet - Szövegbányászat - Gépi tanulás - NLP Meetup - Precognox

NLP erőforrások - meetup prezentációk

2015.04.29. 20:52 Szerző: Zoltán Varjú Címkék: prezentáció korpuszok NLP meetup NLP erőforrások

Szólj hozzá! • Kövess Facebookon • Iratkozz fel értesítőre

Textus; szövegek hálójában

2015.04.23. 18:30 Szerző: Zoltán Varjú Címkék: meetup politikai blogok tartalomelemzés hálózatelemzés

Szólj hozzá! • Kövess Facebookon • Iratkozz fel értesítőre

NLP erőforrások az áprilisi meetupon

2015.04.22. 12:49 Szerző: Zoltán Varjú Címkék: meetup korpuszok NLP meetup

Szólj hozzá! • Kövess Facebookon • Iratkozz fel értesítőre

Politikai blogokkal foglalkozó projektünk a Media Hungary-n

2015.04.20. 08:19 Szerző: Zoltán Varjú Címkék: konferencia politikai blogok Media Hungary

Szólj hozzá! • Kövess Facebookon • Iratkozz fel értesítőre

Olvasni jó? MeetOFF április 23-án

2015.04.16. 08:46 Szerző: Zoltán Varjú Címkék: meetup politikai blogok meetoff

Szólj hozzá! • Kövess Facebookon • Iratkozz fel értesítőre