Outils, méthodes et problèmes de traitement d'un corpus multilingue: le cas du journal "Simpaticuni" (Tunis, 1911-1933)

Dans cette communication nous voudrions présenter les outils, méthodes et problèmes de traitement d'un corpus multilingue. Un des objectifs de notre thèse est d'identifier et d'analyser le tissu linguistique du "Simpaticuni", journal italien, prétendu dialectal, édité à Tunis de 1911 à 1933. Les textes composant le corpus sont des chroniques rédigées en langue hybride, mélangeant le sicilien et l'italien normé avec des occurrences de la variété dialectale d'arabe tunisien et du français. Nous voudrions examiner plus particulièrement le fonctionnement de l'emprunt à l'arabe tunisien. Nous proposons d'exposer les problèmes techniques auxquels nous sommes confrontés tels que le grand format des feuilles du journal et la variation linguistique qui rendent la numérisation difficile. Nous évoquerons le problème de l'étendue du corpus et de sa représentativité. Nous présenterons les logiciels que nous prévoyons d'employer tels que Lexico3 et Unitex, ainsi que les méthodes envisagées.

Data and Resources

Additional Info

Field Value
Source Traitement de corpus: outils et méthodes, COLDOC 2012 (colloque des doctorants et jeunes chercheurs du laboratoire MoDyCo)
Author Zlitni, Mériem
Maintainer CCSD
Last Updated May 10, 2026, 17:52 (UTC)
Created May 10, 2026, 17:52 (UTC)
Identifier halshs-00833714
Language fr
Rights https://about.hal.science/hal-authorisation-v1/
contributor Modèles, Dynamiques, Corpus (MoDyCo) ; Université Paris Nanterre (UPN)-Centre National de la Recherche Scientifique (CNRS)
coverage Paris, France
creator Zlitni, Mériem
date 2012-10-04T00:00:00
harvest_object_id 18a73e3c-f4db-4fe5-9b0b-6eb30c87fa3d
harvest_source_id 3374d638-d20b-4672-ba96-a23232d55657
harvest_source_title test moissonnage SELUNE
metadata_modified 2023-12-21T00:00:00
set_spec type:COMM