„Lemur Project” változatai közötti eltérés
(Egy közbenső módosítás ugyanattól a szerkesztőtől nincs mutatva) | |||
1. sor: | 1. sor: | ||
− | 2000-ben a Center for Intelligent Information Retrieval (University of Massachusetts) és a Language Technologies Institute (Carnegie Mellon University) által indított projekt, amelynek keretében különféle open source szövegelemző szoftvereket, böngésző kiegészítőket és keresőgépeket fejlesztenek statisztikai nyelvészeti vizsgálatokhoz. Ezekhez a szövegbányászati kutatásokhoz nagy, megvásárolható adatbázisokat is kínálnak, amelyek archivált weboldalakból állnak. A ClueWeb09 nevű adathalmaz 2009 januárjában és februárjában lett begyűjtve, és tízféle nyelven íródott, több mint 1 milliárd weboldalt tartalmaz, a mérete |
+ | 2000-ben a Center for Intelligent Information Retrieval (University of Massachusetts) és a Language Technologies Institute (Carnegie Mellon University) által indított projekt, amelynek keretében különféle open source szövegelemző szoftvereket, böngésző kiegészítőket és keresőgépeket fejlesztenek statisztikai nyelvészeti vizsgálatokhoz. Ezekhez a szövegbányászati kutatásokhoz nagy, megvásárolható adatbázisokat is kínálnak, amelyek archivált weboldalakból állnak. A ClueWeb09 nevű adathalmaz 2009 januárjában és februárjában lett begyűjtve, és tízféle nyelven íródott, több mint 1 milliárd weboldalt tartalmaz, a mérete 5 terabájt (tömörítetlenül 25 TB). Az ezt később kiegészítő ClueWeb12 pedig 2012 tavaszán learatott 733 millió angol nyelvű weboldal halmaza. |
---- |
---- |
A lap jelenlegi, 2018. március 18., 20:24-kori változata
2000-ben a Center for Intelligent Information Retrieval (University of Massachusetts) és a Language Technologies Institute (Carnegie Mellon University) által indított projekt, amelynek keretében különféle open source szövegelemző szoftvereket, böngésző kiegészítőket és keresőgépeket fejlesztenek statisztikai nyelvészeti vizsgálatokhoz. Ezekhez a szövegbányászati kutatásokhoz nagy, megvásárolható adatbázisokat is kínálnak, amelyek archivált weboldalakból állnak. A ClueWeb09 nevű adathalmaz 2009 januárjában és februárjában lett begyűjtve, és tízféle nyelven íródott, több mint 1 milliárd weboldalt tartalmaz, a mérete 5 terabájt (tömörítetlenül 25 TB). Az ezt később kiegészítő ClueWeb12 pedig 2012 tavaszán learatott 733 millió angol nyelvű weboldal halmaza.