Téléchargements
Le corpus complet, libre de réutilisation
Ces exports proviennent directement de la base de travail du projet et peuvent, ponctuellement, conserver des annotations de process interne (échanges de relecture, points en attente d'arbitrage) dans le corps de certaines fiches lexicales — laissées en l'état par souci de transparence plutôt que retirées artificiellement.
Texte arabe (lectures Hafs et Warsh), segmentation en unités de sens, traductions en français, anglais, espagnol, italien, indonésien et russe, lexique des racines stabilisées.
Contenu : arabic_soura, arabic_phrase, arabic_words, root_knowledge, readings, translations
Format : SQLite (.sqlite) + README + LICENSE · Taille : ~10 MB
Infrastructure d'analyse construite sur le corpus : cooccurrences de racines, graphe sémantique, morphologie, règles grammaticales déduites, murs thématiques stabilisés.
Contenu : root_cooccurrence, semantic_nodes/edges, racine_liens, regles_grammaticales, clusters, root_forme/geste/objet…
Format : SQLite (.sqlite) + README + LICENSE · Taille : ~3 MB
Version plate, tableur-compatible, des phrases, mots et racines — pour qui préfère éviter SQLite.
Contenu : phrases.csv, mots.csv, racines.csv, soura.csv
Format : CSV (UTF-8) + README + LICENSE · Taille : ~6 MB