HTML

Precognox

precognox_logo_190.jpg

A blog készítői a Precognox Kft. keretein belül fejlesztenek intelligens, nyelvészeti alapokra épülő keresési, szövegbányászati és big data megoldásokat.

Ha a blogon olvasható tartalmak kapcsán, vagy témáink alapján úgy gondolod megoldhatjuk problémáidat, lépj velünk kapcsolatba a keresovilag@precognox.com címen.

Meetup ajánló

Blog figyelése (RSS)

 Add hozzá az RSS olvasódhoz

Ha levélben szeretnél értesülni az új cikkekről:

opendata.hu

opendatahu45.jpg

Az opendata.hu egy ingyenes és nyilvános magyar adatkatalógus. Az oldalt önkéntesek és civil szervezetek hozták létre azzal a céllal, hogy megteremtsék az első magyar nyílt adatokat, adatbázisokat gyűjtő weblapot. Az oldalra szabadon feltölthetőek, rendszerezhetőek szerzői jogvédelem alatt nem álló, nyilvános, illetve közérdekű adatok.

Az opendata.hu oldalt a Magyar OpenData Alapítvány/Egyesület hivatalos megalakulásáig - lelkes önkéntesek segítségével a
K-Monitor Közhasznú Egyesület (K-Monitor) működteti, az üzemeltetést a Precognox végzi.

A blog tartalmai CC licenc alá tartoznak

Creative Commons License
Kereső Világ by Precognox Kft. is licensed under a Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International License.
Based on a work at http://kereses.blog.hu/.
Permissions beyond the scope of this license may be available at http://precognox.com/.

A Kereső Világ blogon közölt tartalmak a Precognox Kft. tulajdonát képezik. A tartalom újraközléséhez, amennyiben nem kereskedelmi céllal történik, külön engedély nem szükséges, ha linkeled az eredeti tartalmat és feltünteted a tulajdonos nevét is (valahogy így: Ez az írás a Precognox Kft. Kereső Világ blogján jelent meg). Minden más esetben fordulj hozzánk, a zoltan.varju(kukac)precognox.com címre írt levéllel.

Creative Commons License

Nevezd meg! - Ne add el! - Ne változtasd!

 

Textus; szövegek hálójában

2015.04.23. 18:30 Szerző: zoltanvarju Címkék: meetup politikai blogok tartalomelemzés hálózatelemzés

Mai MeetOFF előadásom diái.

 

 

img_20150423_233130.jpg

A Kereső Világ a precognox_logo_190.jpg Precognox szakmai blogja A Precognox intelligens, nyelvészeti alapokra építő keresési, szövegbányászati és big data megoldások fejlesztője.

Szólj hozzá! • Kövess Facebookon • Iratkozz fel értesítőre

NLP erőforrások az áprilisi meetupon

2015.04.22. 12:49 Szerző: zoltanvarju Címkék: meetup korpuszok NLP meetup

Április 29-én tartjuk meetupunkat, 18 órától a megszokott helyen a Colabs-ben. Rövid, ötperces előadások keretében mindenki megismerheti a magyar korpuszokat. Érdemes eljönni, mert egyrészt tök jó előadások lesznek, másrészt meg továbbra is ingyenes a rendezvény, de regelni azért nem árt a meetup.com-on itt, vagy Facebookon itt.

logo9_final.jpg

Vincze Veronika (MTA-SZTE Mesterséges Intelligencia Kutatócsoport) 

A Szeged Korpusz és Treebank 

Az előadásban bemutatjuk a Szeged Korpusz és Treebank nevű adatbázist, mely a maga 1,2 millió szavával a legnagyobb, teljes egészében kézzel annotált, magyar nyelvű szövegkorpusz. A korpusz hét különböző doménből származó szövegeket foglal magában, ezek számos annotációs réteggel rendelkeznek: megtalálható bennük az egyes szövegszavak összes lehetséges, illetve a kontextusnak megfelelő morfológiai kódja, minden egyes mondathoz hozzá van rendelve annak szintaktikai szerkezete kétféle elméleti keret szerint is, továbbá szemantikai jellegű annotációk is találhatók egyes részkorpuszokban. 

Korpuszok az információkinyerésben 

A szövegekben található információk hatékony kinyeréséhez számos nyelvi jelenséget tudnunk kell kezelni, mint például tulajdonnevek és névelemek, többszavas kifejezések, nyelvi bizonytalanság és szubjektivitás. Az előadásban bemutatjuk azokat a Szegeden készült korpuszokat, amelyek különböző doménekből és nyelvekből származó szövegeket tartalmaznak, és bennük nyelvész szakértők kézzel megjelölték az előbb említett jelenségeket, így tanító és tesztadatbázisként szolgálhatnak az információkinyerő rendszerek különböző moduljaihoz. 

 

Sass Bálint (MTA Nyelvtudományi Intézet, Nyelvtechnológiai Kutatócsoport)

28 millió szintaktikailag elemzett mondat és 500000 igei szerkezet

Mondataink jelentős része úgy épül fel, hogy egy központi ige körül rendeződnek el az ige különféle bővítményei. Pl.:elrendeződik + mi? bővítmény + mi körül? ige körül. Az ilyen „mondatvázakat'' nevezzük igei szerkezeteknek, tartalmazzanak vonzatot (hisz vmiben), konkrét szókapcsolatot (döntés születik) vagy akár a kettő kombinációját (igényt tart vmire). Az előadás egy nyelvi erőforrást mutat be: magyar igei szerkezetek korpuszból automatikusan kinyert igen jelentős méretű gyűjteményét. Ez a gyűjtemény információt ad az igék és a bővítmények szokásos viselkedéséről, tulajdonságairól, a szelekciós preferenciákról, így hasznos lehet magyar nyelvű szöveg tartalmi, szemantikai feldolgozása során. A fentit egészíti ki egy másik erőforrás: a 28 millió sekély elemzéssel ellátott tagmondatból álló korpusz, melyből az igei szerkezetek származnak. Kutatási célra szabadon, üzleti célra egyedi megállapodás keretében férhetők hozzá.

 

Miháltz Márton (MTA Nyelvtudományi Intézet, Nyelvtechnológiai Kutatócsoport)

Magyar WordNet

A Magyar WordNet (HuWN) a Princeton WordNet elveit követve a nyelvi fogalmakat szinonimahalmazokkal (synsetekkel) reprezentálja és közöttük szemantikai viszonyokat definiálva (pl. hipernima (is-a), meronima (rész-egész), antonima stb.) hoz létre egy lexikális fogalmi hálózatot. Noha a wordnetekben a nyelvi fogalmak közötti taxonómia nem felel meg egy szigorú formális ontológia követelményeinek, az NLP különböző alkalmazásaiban mégis gyakran használják őket világismereti reprezentáció forrásaként. A Magyar WordNet 42 ezer synsetet tartalmaz, és össze van kapcsolva az angol (Princeton) WordNet 2.0-ás és 3.0-s verzióival, ami átjárást biztosít több mint 20 egyéb nyelv wordnetjeihez, illetve az angol wordnethez illeszkedő egyéb adatbázisokhoz (Yago, DBPedia, BabelNet stb.). A HuWN szabadon hozzáférhető.

 

Ács Judit (MTA Nyelvtudományi Intézet, Matematikai Nyelvészeti Kutatócsoport)

Online soknyelvű szótárak

A kétnyelvű szótárak fontos építőelemei számos NLP alkalmazásnak, azonban előállításuk rendkívül idő- és pénzigényes, ezért az automatikus szótárépítés egyre nagyobb szerepet kap. Bemutatunk egy nyelvfüggetlen módszert, amelynek segítségével a Wiktionaryből kiindulva 53 nyelven összesen 1378 szótárat készült, köztük valószínüleg az első, gép által is olvasható magyar-vietnámi szótár. 

 

Simon Eszter (MTA Nyelvtudományi Intézet, Nyelvtechnológiai Kutatócsoport) 

Silver standard korpuszok tulajdonnév-felismeréshez 

A felügyelt gépi tanulási módszerek alkalmazásához nagyméretű annotált korpuszokra van szükség, amelyek előállítása rendkívül emberierőforrás-igényes. Több lehetőség van az annotációs költségek csökkentésére, ezek közül az egyik az automatikus annotálás. Az előadásban egy olyan nyelvfüggetlen módszert mutatunk be, mellyel bármely Wikipédiával rendelkező nyelvre előállítható tulajdonnévi címkéket tartalmazó korpusz. Az automatikus annotálás során a DBpedia ontológiai kategóriáit képeztük le CoNLL-névosztályokra. Az így előállított magyar és angol nyelvű korpuszok ugyan silver standard korpuszok, de a kiértékelésünk alapján hasonlóan jól használhatók felügyelt névfelismerő rendszerek tanításához és kiértékeléséhez, mint a gold standard korpuszok. 

A Kereső Világ a precognox_logo_190.jpg Precognox szakmai blogja A Precognox intelligens, nyelvészeti alapokra építő keresési, szövegbányászati és big data megoldások fejlesztője.

Szólj hozzá! • Kövess Facebookon • Iratkozz fel értesítőre

Politikai blogokkal foglalkozó projektünk a Media Hungary-n

2015.04.20. 08:19 Szerző: zoltanvarju Címkék: konferencia politikai blogok Media Hungary

Május 12. és 13. között kerül megrendezésre az idei Media Hungary, amin bemutatjuk politikai blogokkal foglalkozó projektünket. 

mediahungary.jpg

Kontextus és a hivatkozások ereje című előadásunk a második napon, a Tartalommarketing szekcióban 15:15-kor kezdődik és kb. az alábbiakról fogunk beszélni:

Hogyan hivatkoznak egymásra a profi szerzők és a webkettes tartalomgyártók? Kik tematizálják az online világot? A Nyelv és Tudománnyal indított projektünk keretében egy hetven blogot tartalmazó listát használva több mint tizenkétezer magyar nyelvű egyedi oldalt gyűjtöttünk be, s ezek között több mint huszonkétezer linket találtunk. Adatainkra alapozva megvizsgáltuk a közéleti szféra topológiáját, azaz hogy kik a legbefolyásosabb szereplők, kiken keresztül áramlik a legtöbb információ, kik linkelnek a leglelkesebben, kik kapják a legtöbb linket. A hagyományos hálózati elemzést szöveganalitikai megoldásokkal ötvözve megvizsgáljuk milyen témák jelennek meg a hálózaton s hogyan terjednek azok térben és időben. Végezetül kitérünk arra is, hogy milyen érzelmek kapcsolódnak az egyes témákhoz és milyen érzelmek kísérik az egyes hivatkozásokat.

A Kereső Világ a precognox_logo_190.jpg Precognox szakmai blogja A Precognox intelligens, nyelvészeti alapokra építő keresési, szövegbányászati és big data megoldások fejlesztője.

Szólj hozzá! • Kövess Facebookon • Iratkozz fel értesítőre

Olvasni jó? MeetOFF április 23-án

2015.04.16. 08:46 Szerző: zoltanvarju Címkék: meetup politikai blogok meetoff

Április 23-án a MeetOFF Olvasni jó? - Olvasás a 21. században meetupján adok elő. A rendezvényre itt lehet regisztrálni, a belépő 1000 HUF PayPalon fizetve, 1500 a helyszínen. A meetupon főleg könyvekről és az olvasásról hallhattok majd, én politikai blogos projektünkről fogok beszélni.

 directed_articulation.png

“Az elektronikus hálózat révén az emberek teljesen bevonódnak egymás életébe. Közvetlenül és szakadatlan ömlik ránk az információ, melyet alighogy feldolgoztunk, máris követ az új, aztán még újabb adag.Elektronikussá alakított világunk arra sarkall bennünket, hogy kategorizáló szokásunkat mintázatfelismerő eljárásra cseréljük.” McLuhan már 1967-ben felhívta a figyelmet arra, hogy elárasztanak minket az információk, pedig akkor még nem voltak se blogok, se híroldalak, se közösségi média. Az, hogy az olvasó szelektálja mit olvas, s ez a szelekció mintegy burokba zárja őt, egyre ismertebb. Minket az érdekel hogy a tartalmak előállítói is saját világukban élnek-e? Kikre hivatkoznak a hírek szerzői és a politikai blogok véleményvezérei? Van-e átjárás a megannyi politkai nézetet valló szerző között? Hatnak-e egymásra azok, akik a közvéleményt formálják?
A Nyelv és Tudománnyal elindított projektünk során 12 121 posztot/cikket gyűjtöttünk be. Vizsgálataink során a klasszikus linkelemzést (pl. PageRank, be- és kimenő élek száma, stb.) szeretnénk a tartalomelemzés módszereivel ötvözni, s olyan kérdésekre megtalálni a választ mint:

  • milyen témák foglalkoztatják a híroldalakat és blogokat
  • honnét indul el egy-egy téma
  • hogyan terjed egy téma
  • milyen érzelmek tapadnak egy témához

A Kereső Világ a precognox_logo_190.jpg Precognox szakmai blogja A Precognox intelligens, nyelvészeti alapokra építő keresési, szövegbányászati és big data megoldások fejlesztője.

Szólj hozzá! • Kövess Facebookon • Iratkozz fel értesítőre

New KConnect search services give healthcare the very best in medical information

2015.04.14. 08:43 Szerző: zoltanvarju Címkék: medical health search KConnect Horizon 2020 semantic search

Today KConnect launches its official website: www.kconnect.eu and begins the commercialisation of new multi-lingual medical text analysis and search services.

kconnect_logo_450px.png

The new state-of-the-art medical information search services have the ability to empower healthcare and life science professionals and the public alike. The search services can provide the fastest and most relevant medical support information available from which users can make the best-informed decisions. 

The intelligent (semantic) search services can incorporate both published medical literature and in-house medical information sources (such as electronic health records or health registries).

The quality of the search performance can help clinicians and researchers remain at the forefront of their profession. By having the right knowledge about best practices and treatments at their fingertips, clinicians can ensure the very best in patient outcomes and a healthier community, says Professor Robert Stewart, Department of Psychological Medicine, King’s College London.

Intelligent search for better user experience
The search services have been made ‘intelligent’ by understanding the meaning/context/intent of user queries. The very best in medical information is made more findable by the fact that the semantic search is not just based on query keywords but also on related concepts and contexts.

The user search box has the ability to understand keyword connotations, related concepts and their relationships within a medical context. Such machine comprehension is also employed in the ‘reading’ (indexing, classifying and annotating) of medical content so that the most relevant information can be found even if a user’s chosen keyword happens to be absent within the text.

Search global medical information in any language
The accurate language mapping of key medical concepts allows users to search in their own language (currently there are several European languages available with more to follow). The addition of machine translation means that information can be provided either in English or the source’s original language.
 
Building blocks for tailored medical services
Individually created components and toolkits mean that an organisation can tailor its search-driven medical solutions according to its own requirements. There are several tailoring options available including information sources, access (cloud or local installation), language, security, functionality (alerts, recommendations and social search) and whether the created solution is either standalone or embedded.

Partnership opportunities
Due to the expected demand for its services, KConnect is looking to extend its Professional Service Community by looking for new partners to help with the quick and wider adoption of its services.


Contacts
Sales (Northern Europe): Mikael Hallin
Email: mikael.hallin@findwise.com
Mobile: +46 (0)725 455105
www.findwise.com

Sales (Eastern Europe): Endre Jofoldi
Email: endre.jofoldi@precognox.com
Mobile: +36 (0)208 861391
www.precognox.com

Research: Allan Hanbury
Email: allan.hanbury@tuwien.ac.at
Mobile: +43 1 58801 188310
www.tuwien.ac.at

The KConnect Consortium:
Vienna University of Technology (Austria); Findwise AB (Sweden); Precognox Kft (Hungary); Ontotext AD (Bulgaria); Trip Database Ltd (UK); Health on the Net Foundation (Switzerland); Qulturum, Region Jönköping County (Sweden); King’s College London (UK); University of Sheffield (UK); Charles University, Prague (Czech Republic).

Source: PRNewsWire

A Kereső Világ a precognox_logo_190.jpg Precognox szakmai blogja A Precognox intelligens, nyelvészeti alapokra építő keresési, szövegbányászati és big data megoldások fejlesztője.

Szólj hozzá! • Kövess Facebookon • Iratkozz fel értesítőre