HTML

Precognox

 precognox-logo-cmyk-620.jpg

A blog készítői a Precognox Kft. keretein belül fejlesztenek intelligens, nyelvészeti alapokra épülő keresési, szövegbányászati, big data és gépi tanulás alapú megoldásokat.

Az alábbi keresődoboz segítségével a Precognox által kezelt blogok tartalmában tudsz keresni. A kifejezés megadása után a Keresés gombra kattintva megjelenik vállalati keresőmegoldásunk, ahol további összetett keresések indíthatóak. A találatokra kattintva pedig elérhetőek az eredeti blogbejegyzések.

Ha a blogon olvasható tartalmak kapcsán, vagy témáink alapján úgy gondolod megoldással tudunk szolgálni szöveganalitikai problémádra, lépj velünk kapcsolatba a keresovilag@precognox.com címen.

Precognox Blogkereső

Document

opendata.hu

opendatahu45.jpg

Az opendata.hu egy ingyenes és nyilvános magyar adatkatalógus. Az oldalt önkéntesek és civil szervezetek hozták létre azzal a céllal, hogy megteremtsék az első magyar nyílt adatokat, adatbázisokat gyűjtő weblapot. Az oldalra szabadon feltölthetőek, rendszerezhetőek szerzői jogvédelem alatt nem álló, nyilvános, illetve közérdekű adatok.

Facebook oldaldoboz

Blog figyelése (RSS)

 Add hozzá az RSS olvasódhoz

Ha levélben szeretnél értesülni az új cikkekről:

Star Wars text mining

visualizing_star_wars_movie_scripts_precognox.jpgA long time ago, in a galaxy far, far away data analysts were talking about the upcoming new Star Wars movie. One of them has never seen any eposide of the two trilogies before, so they decided to make the movie more accessible to this poor fellow. See more...

Főbb témák

adat (8) adatbányászat (11) adatelemzés (9) adatok (13) adatújságírás (16) adatvizualizáció (19) AI (19) alternatív (6) alternatív keresőfelület (28) analitika (6) beszédtechnológia (13) big data (55) bing (14) blogkereső (6) CEU (6) clustering (6) conTEXT (8) dashboard (6) data science (9) deep learning (18) egészség (7) egészség kereső (7) előadás (7) emócióelemzés (35) Facebook (9) facebook (8) gépi tanulás (18) google (59) Google (33) gyűlöletbeszéd (7) hackathon (10) hálózatelemzés (14) intelligens keresés (6) internetes keresés (35) internet hungary (6) képfeldolgozás (8) képkereső (8) keresés (87) kereséselmélet (8) keresési felület (6) keresés jövője (57) keresés problémái (41) keresők összehasonlítása (9) keresőmotor (16) keresőoptimalizálás (8) kereső szándéka (11) kereső tanfolyam (9) kereső teszt (15) kognitív nyelvészet (12) konferencia (46) könyvajánló (25) korpusznyelvészet (14) közösségi keresés (8) közösségi média (8) különleges keresők (7) kutatás (9) LDA (10) lda (10) live (13) machine learning (9) magyar kereső (9) marketing (8) meetup (41) mesterséges intelligencia (19) metafora (7) mobil (37) mobil keresés (17) Neticle (9) NLP (8) NLP meetup (17) Nuance (9) nyelv (7) nyelvészet (32) nyelvtechnológia (76) open data (12) open knowledge (7) orosz (6) Pennebaker (6) politikai blogok (22) Precognox (65) Precognox Labs (14) Python (14) R (19) spam (6) statisztika (12) számítógépes nyelvészet (9) szemantikus keresés (19) szemantikus kereső (9) szentimentelemzés (37) szöveganalitika (7) szövegbányászat (22) társadalomtudomány (7) tartalomelemzés (56) tartalomjegyzék (6) tematikus kereső (20) topik modellek (6) twitter (15) Twitter (18) vállalati kereső (7) vertikális kereső (9) vizualizáció (13) yahoo (27) Címkefelhő

A blog tartalmai CC licenc alá tartoznak

Creative Commons License
Kereső Világ by Precognox Kft. is licensed under a Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International License.
Based on a work at http://kereses.blog.hu/.
Permissions beyond the scope of this license may be available at http://precognox.com/.

A Kereső Világ blogon közölt tartalmak a Precognox Kft. tulajdonát képezik. A tartalom újraközléséhez, amennyiben nem kereskedelmi céllal történik, külön engedély nem szükséges, ha linkeled az eredeti tartalmat és feltünteted a tulajdonos nevét is (valahogy így: Ez az írás a Precognox Kft. Kereső Világ blogján jelent meg). Minden más esetben fordulj hozzánk, a zoltan.varju(kukac)precognox.com címre írt levéllel.

Creative Commons License

Nevezd meg! - Ne add el! - Ne változtasd!

 

NLP erőforrások - meetup prezentációk

2015.04.29. 20:52 Szerző: Zoltán Varjú Címkék: prezentáció korpuszok NLP meetup NLP erőforrások

NLP erőforrások meetupunk prezentációit alább közöljük. Köszönet az előadóknak és mindenkinek aki eljött! Miháltz Mártonnak külön köszönet az ötletért, szervezésért és lebonyolításért!

FELHÍVÁS

Vincze Veronika: A Szeged Korpusz és Treebank

 

Vincze Veronika: Korpuszok az információkinyerésben

Sass Bálint: 28 millió szintaktikailag elemzett mondat és 500000 igei szerkezet

Miháltz Márton: Magyar WordNet

Ács Judit: Online soknyelvű szótárak

Simon Eszter: Silver standard korpuszok tulajdonnév-felismeréshez

A Kereső Világ a Precognox Precognox szakmai blogja A Precognox intelligens, nyelvészeti alapokra építő keresési, szövegbányászati és big data megoldások fejlesztője.

Szólj hozzá! • Kövess Facebookon • Iratkozz fel értesítőre

Textus; szövegek hálójában

2015.04.23. 18:30 Szerző: Zoltán Varjú Címkék: meetup politikai blogok tartalomelemzés hálózatelemzés

Mai MeetOFF előadásom diái.

 

 

img_20150423_233130.jpg

A Kereső Világ a Precognox Precognox szakmai blogja A Precognox intelligens, nyelvészeti alapokra építő keresési, szövegbányászati és big data megoldások fejlesztője.

Szólj hozzá! • Kövess Facebookon • Iratkozz fel értesítőre

NLP erőforrások az áprilisi meetupon

2015.04.22. 12:49 Szerző: Zoltán Varjú Címkék: meetup korpuszok NLP meetup

Április 29-én tartjuk meetupunkat, 18 órától a megszokott helyen a Colabs-ben. Rövid, ötperces előadások keretében mindenki megismerheti a magyar korpuszokat. Érdemes eljönni, mert egyrészt tök jó előadások lesznek, másrészt meg továbbra is ingyenes a rendezvény, de regelni azért nem árt a meetup.com-on itt, vagy Facebookon itt.

logo9_final.jpg

Vincze Veronika (MTA-SZTE Mesterséges Intelligencia Kutatócsoport) 

A Szeged Korpusz és Treebank 

Az előadásban bemutatjuk a Szeged Korpusz és Treebank nevű adatbázist, mely a maga 1,2 millió szavával a legnagyobb, teljes egészében kézzel annotált, magyar nyelvű szövegkorpusz. A korpusz hét különböző doménből származó szövegeket foglal magában, ezek számos annotációs réteggel rendelkeznek: megtalálható bennük az egyes szövegszavak összes lehetséges, illetve a kontextusnak megfelelő morfológiai kódja, minden egyes mondathoz hozzá van rendelve annak szintaktikai szerkezete kétféle elméleti keret szerint is, továbbá szemantikai jellegű annotációk is találhatók egyes részkorpuszokban. 

Korpuszok az információkinyerésben 

A szövegekben található információk hatékony kinyeréséhez számos nyelvi jelenséget tudnunk kell kezelni, mint például tulajdonnevek és névelemek, többszavas kifejezések, nyelvi bizonytalanság és szubjektivitás. Az előadásban bemutatjuk azokat a Szegeden készült korpuszokat, amelyek különböző doménekből és nyelvekből származó szövegeket tartalmaznak, és bennük nyelvész szakértők kézzel megjelölték az előbb említett jelenségeket, így tanító és tesztadatbázisként szolgálhatnak az információkinyerő rendszerek különböző moduljaihoz. 

 

Sass Bálint (MTA Nyelvtudományi Intézet, Nyelvtechnológiai Kutatócsoport)

28 millió szintaktikailag elemzett mondat és 500000 igei szerkezet

Mondataink jelentős része úgy épül fel, hogy egy központi ige körül rendeződnek el az ige különféle bővítményei. Pl.:elrendeződik + mi? bővítmény + mi körül? ige körül. Az ilyen „mondatvázakat'' nevezzük igei szerkezeteknek, tartalmazzanak vonzatot (hisz vmiben), konkrét szókapcsolatot (döntés születik) vagy akár a kettő kombinációját (igényt tart vmire). Az előadás egy nyelvi erőforrást mutat be: magyar igei szerkezetek korpuszból automatikusan kinyert igen jelentős méretű gyűjteményét. Ez a gyűjtemény információt ad az igék és a bővítmények szokásos viselkedéséről, tulajdonságairól, a szelekciós preferenciákról, így hasznos lehet magyar nyelvű szöveg tartalmi, szemantikai feldolgozása során. A fentit egészíti ki egy másik erőforrás: a 28 millió sekély elemzéssel ellátott tagmondatból álló korpusz, melyből az igei szerkezetek származnak. Kutatási célra szabadon, üzleti célra egyedi megállapodás keretében férhetők hozzá.

 

Miháltz Márton (MTA Nyelvtudományi Intézet, Nyelvtechnológiai Kutatócsoport)

Magyar WordNet

A Magyar WordNet (HuWN) a Princeton WordNet elveit követve a nyelvi fogalmakat szinonimahalmazokkal (synsetekkel) reprezentálja és közöttük szemantikai viszonyokat definiálva (pl. hipernima (is-a), meronima (rész-egész), antonima stb.) hoz létre egy lexikális fogalmi hálózatot. Noha a wordnetekben a nyelvi fogalmak közötti taxonómia nem felel meg egy szigorú formális ontológia követelményeinek, az NLP különböző alkalmazásaiban mégis gyakran használják őket világismereti reprezentáció forrásaként. A Magyar WordNet 42 ezer synsetet tartalmaz, és össze van kapcsolva az angol (Princeton) WordNet 2.0-ás és 3.0-s verzióival, ami átjárást biztosít több mint 20 egyéb nyelv wordnetjeihez, illetve az angol wordnethez illeszkedő egyéb adatbázisokhoz (Yago, DBPedia, BabelNet stb.). A HuWN szabadon hozzáférhető.

 

Ács Judit (MTA Nyelvtudományi Intézet, Matematikai Nyelvészeti Kutatócsoport)

Online soknyelvű szótárak

A kétnyelvű szótárak fontos építőelemei számos NLP alkalmazásnak, azonban előállításuk rendkívül idő- és pénzigényes, ezért az automatikus szótárépítés egyre nagyobb szerepet kap. Bemutatunk egy nyelvfüggetlen módszert, amelynek segítségével a Wiktionaryből kiindulva 53 nyelven összesen 1378 szótárat készült, köztük valószínüleg az első, gép által is olvasható magyar-vietnámi szótár. 

 

Simon Eszter (MTA Nyelvtudományi Intézet, Nyelvtechnológiai Kutatócsoport) 

Silver standard korpuszok tulajdonnév-felismeréshez 

A felügyelt gépi tanulási módszerek alkalmazásához nagyméretű annotált korpuszokra van szükség, amelyek előállítása rendkívül emberierőforrás-igényes. Több lehetőség van az annotációs költségek csökkentésére, ezek közül az egyik az automatikus annotálás. Az előadásban egy olyan nyelvfüggetlen módszert mutatunk be, mellyel bármely Wikipédiával rendelkező nyelvre előállítható tulajdonnévi címkéket tartalmazó korpusz. Az automatikus annotálás során a DBpedia ontológiai kategóriáit képeztük le CoNLL-névosztályokra. Az így előállított magyar és angol nyelvű korpuszok ugyan silver standard korpuszok, de a kiértékelésünk alapján hasonlóan jól használhatók felügyelt névfelismerő rendszerek tanításához és kiértékeléséhez, mint a gold standard korpuszok. 

A Kereső Világ a Precognox Precognox szakmai blogja A Precognox intelligens, nyelvészeti alapokra építő keresési, szövegbányászati és big data megoldások fejlesztője.

Szólj hozzá! • Kövess Facebookon • Iratkozz fel értesítőre

Politikai blogokkal foglalkozó projektünk a Media Hungary-n

2015.04.20. 08:19 Szerző: Zoltán Varjú Címkék: konferencia politikai blogok Media Hungary

Május 12. és 13. között kerül megrendezésre az idei Media Hungary, amin bemutatjuk politikai blogokkal foglalkozó projektünket. 

mediahungary.jpg

Kontextus és a hivatkozások ereje című előadásunk a második napon, a Tartalommarketing szekcióban 15:15-kor kezdődik és kb. az alábbiakról fogunk beszélni:

Hogyan hivatkoznak egymásra a profi szerzők és a webkettes tartalomgyártók? Kik tematizálják az online világot? A Nyelv és Tudománnyal indított projektünk keretében egy hetven blogot tartalmazó listát használva több mint tizenkétezer magyar nyelvű egyedi oldalt gyűjtöttünk be, s ezek között több mint huszonkétezer linket találtunk. Adatainkra alapozva megvizsgáltuk a közéleti szféra topológiáját, azaz hogy kik a legbefolyásosabb szereplők, kiken keresztül áramlik a legtöbb információ, kik linkelnek a leglelkesebben, kik kapják a legtöbb linket. A hagyományos hálózati elemzést szöveganalitikai megoldásokkal ötvözve megvizsgáljuk milyen témák jelennek meg a hálózaton s hogyan terjednek azok térben és időben. Végezetül kitérünk arra is, hogy milyen érzelmek kapcsolódnak az egyes témákhoz és milyen érzelmek kísérik az egyes hivatkozásokat.

A Kereső Világ a Precognox Precognox szakmai blogja A Precognox intelligens, nyelvészeti alapokra építő keresési, szövegbányászati és big data megoldások fejlesztője.

Szólj hozzá! • Kövess Facebookon • Iratkozz fel értesítőre

Olvasni jó? MeetOFF április 23-án

2015.04.16. 08:46 Szerző: Zoltán Varjú Címkék: meetup politikai blogok meetoff

Április 23-án a MeetOFF Olvasni jó? - Olvasás a 21. században meetupján adok elő. A rendezvényre itt lehet regisztrálni, a belépő 1000 HUF PayPalon fizetve, 1500 a helyszínen. A meetupon főleg könyvekről és az olvasásról hallhattok majd, én politikai blogos projektünkről fogok beszélni.

 directed_articulation.png

“Az elektronikus hálózat révén az emberek teljesen bevonódnak egymás életébe. Közvetlenül és szakadatlan ömlik ránk az információ, melyet alighogy feldolgoztunk, máris követ az új, aztán még újabb adag.Elektronikussá alakított világunk arra sarkall bennünket, hogy kategorizáló szokásunkat mintázatfelismerő eljárásra cseréljük.” McLuhan már 1967-ben felhívta a figyelmet arra, hogy elárasztanak minket az információk, pedig akkor még nem voltak se blogok, se híroldalak, se közösségi média. Az, hogy az olvasó szelektálja mit olvas, s ez a szelekció mintegy burokba zárja őt, egyre ismertebb. Minket az érdekel hogy a tartalmak előállítói is saját világukban élnek-e? Kikre hivatkoznak a hírek szerzői és a politikai blogok véleményvezérei? Van-e átjárás a megannyi politkai nézetet valló szerző között? Hatnak-e egymásra azok, akik a közvéleményt formálják?
A Nyelv és Tudománnyal elindított projektünk során 12 121 posztot/cikket gyűjtöttünk be. Vizsgálataink során a klasszikus linkelemzést (pl. PageRank, be- és kimenő élek száma, stb.) szeretnénk a tartalomelemzés módszereivel ötvözni, s olyan kérdésekre megtalálni a választ mint:

  • milyen témák foglalkoztatják a híroldalakat és blogokat
  • honnét indul el egy-egy téma
  • hogyan terjed egy téma
  • milyen érzelmek tapadnak egy témához

A Kereső Világ a Precognox Precognox szakmai blogja A Precognox intelligens, nyelvészeti alapokra építő keresési, szövegbányászati és big data megoldások fejlesztője.

Szólj hozzá! • Kövess Facebookon • Iratkozz fel értesítőre

süti beállítások módosítása