„Metawarc” változatai közötti eltérés

Innen: MIA
 
1. sor: 1. sor:
 
{{DISPLAYTITLE:metawarc}}
 
{{DISPLAYTITLE:metawarc}}
 
 
Örmény programozó által Pythonban írt open source program, mellyel a parancssori paramétereknek megfelelő fájlok technikai metaadatai gyűjthetők ki [[WARC]] konténerekből. A fájlok formátuma megadható MIME típusként, de fájlvégződésként is (pl.: .docx, .xlsx, .pptx., .pdf, .png, .jpg). A kigyűjtött adatok JSON vagy NDJSON (Newline Delimited JSON) szöveges állományokba vagy közvetlenül SQLite adatbázisba menthetők. A metaadatokon kívül a nyers szövegek, vagy akár maguk az eredeti fájlok is kiszedhetők vele a WARC-okból.
 
Örmény programozó által Pythonban írt open source program, mellyel a parancssori paramétereknek megfelelő fájlok technikai metaadatai gyűjthetők ki [[WARC]] konténerekből. A fájlok formátuma megadható MIME típusként, de fájlvégződésként is (pl.: .docx, .xlsx, .pptx., .pdf, .png, .jpg). A kigyűjtött adatok JSON vagy NDJSON (Newline Delimited JSON) szöveges állományokba vagy közvetlenül SQLite adatbázisba menthetők. A metaadatokon kívül a nyers szövegek, vagy akár maguk az eredeti fájlok is kiszedhetők vele a WARC-okból.
   

A lap jelenlegi, 2024. május 27., 16:56-kori változata

Örmény programozó által Pythonban írt open source program, mellyel a parancssori paramétereknek megfelelő fájlok technikai metaadatai gyűjthetők ki WARC konténerekből. A fájlok formátuma megadható MIME típusként, de fájlvégződésként is (pl.: .docx, .xlsx, .pptx., .pdf, .png, .jpg). A kigyűjtött adatok JSON vagy NDJSON (Newline Delimited JSON) szöveges állományokba vagy közvetlenül SQLite adatbázisba menthetők. A metaadatokon kívül a nyers szövegek, vagy akár maguk az eredeti fájlok is kiszedhetők vele a WARC-okból.