Manuel de Lingui

Claudia Polzin-Haumann · Chapitre 31 sur 33

Pages du PDF

Manuel de Lingui

9783110302219-030

Achim Stein

 

28 Linguistique française et ressources

 

électroniques

 

Abstract : Cette contribution présente les changements récents que les ressources électroniques ont apportés au contenu et aux méthodes de la recherche linguistique.

Elle présente un choix de ressources linguistiques du point de vue des possibilités

techniques des linguistes « théoriques », c’est-à-dire non spécialisés dans le do-maine du traitement automatique des langues (TAL).

 

Keywords : ressources électroniques, traitement automatique des langues, outils lin-

guistiques, corpus textuels, langages de balisage

 

1 Introduction

 

Il y a plus de vingt ans, Fillmore opposa de manière caricaturale la linguistique

théorique (armchair linguistics) à la linguistique des corpus, et dit à propos de leurs représentants :

 

« These two don’t speak to each other very often, but when they do, the corpus linguist says to the

armchair linguist, ‹ Why should I think that what you tell me is true ? ›, and the armchair linguist

says to the corpus linguist, ‹ Why should I think that what you tell me is interesting ? › » (Fillmore

1992, 35).

 

À cette époque les ordinateurs personnels avaient conquis une place sur le

bureau de beaucoup de linguistes, et certains s ’en servaient non seulement pour rédiger leurs publications, mais pour analyser la matière première, le langage. Il

n’y a pas lieu d’approfondir la polémique de Fillmore, puisqu’il fait allusion à une opposition entre linguistique théorique et linguistique empirique qui est

aujourd ’hui obsolète, et ce pour deux raisons. Pour ce qui est de la linguistique

théorique, il est vrai qu’elle ne repose pas principalement sur les ressources électroniques, mais on peut néanmoins constater une tendance croissante à

fonder les publications actuelles sur les données empiriques, que ce soit dans les études synchroniques ou diachroniques. Pour ce qui est de la linguistique des

corpus, on constate qu’elle s’appuie aujourd’hui sur des ressources si importantes et des outils si performants que ses résultats éclairent les recherches théoriques au même niveau que les disciplines empiriques bien établies, comme la psycho-

linguistique p. ex.

 

Unauthenticated

Download Date | 5/25/16 3:06 PM

682 Achim Stein

 

Cette contribution ne tentera pas de dresser l ’inventaire des ressources disponi-bles 1 : il y en aurait trop, et une liste sur papier se périmerait vite et serait peu utile.

En revanche, elle tentera (a) d ’évaluer la signification des ressources pour la recher-che linguistique actuelle, (b) de réfléchir à la façon dont elles influencent les

conditions de travail des linguistes « 2 théoriques » et les résultats des recherches en linguistique et (c) de présenter certains développements récents qui aident à

combler, notamment en linguistique de corpus, le fossé entre les études théoriques et empiriques.

La place qu’occupe la linguistique à l’intérieur du domaine des humanités numé-riques (digital humanities) est partagée par la linguistique computationnelle et la

linguistique proprement dite (ou, si l’on préfère, « traditionnelle »). Cette contribution est écrite dans la perspective du linguiste qui utilise certaines méthodes et applica-tions computationnelles et qui a une expérience modeste dans le développement de

ressources linguistiques utilisées dans le traitement automatique des langues (TAL).

 

2 Ressources

 

2.1 Annotation et standardisation

 

Bien que n’importe quel texte brut puisse en principe être l’objet d’une étude linguis-tique, cette partie se consacrera exclusivement aux corpus « annotés ». Cela signifie

que le texte est enrichi au moins d ’une annotation structurale, en général sous forme

d’un balisage XML (Extensible Markup Language). Même une telle annotation rudi-mentaire peut contenir de l’information linguistique lorsqu’elle reflète le découpage

d’un texte en paragraphes, en phrases ou en mots. Une « véritable » annotation linguistique ajoute cependant le résultat de l’analyse phonétique, morphologique, syntaxique ou sémantique au texte en question.

Cette évolution de la linguistique de corpus a profondément changé et enrichi les

recherches en linguistique. D’une part, en approfondissant la coopération entre linguistique et informatique, elle a contribué à la création de la linguistique computa-

tionnelle, de l’autre elle a amené une partie des linguistes soit à développer des ressources pour le TAL soit à les exploiter pour développer ou vérifier leurs hypothè-ses théoriques.

Sur le plan technique, l’annotation linguistique est en principe indépendante du

texte dans la mesure où les types d ’informations se trouvent non seulement à l’inté-

 

1 C’est aussi pour cette raison que nous indiquerons le nom des sites ou des institutions plutôt que de fournir des URL (adresses internet) précises, mais peu durables.

2 Pour faciliter ma tâche, j’utilise linguistes théoriques par opposition à linguistes de corpus, conscient du fait que ce choix terminologique n’est pas le plus heureux, mais théorique est moins connoté que moyen (dépréciatif pour les linguistes théoriques) ou normal (dépréciatif pour les linguistes de corpus).

 

Unauthenticated

Download Date | 5/25/16 3:06 PM

Linguistique française et ressources électroniques 683

 

rieur du balisage XML, mais aussi bien délimités, comme le montre l’exemple suivant où les annotations « morphologie » et « lemme » sont représentées par deux attributs

distincts de la balise « mot » :

 

(1) <mot id="3125" morph="ADJ" lemme="gros">grosse</mot>

 

Un tel balisage permet d’ajouter ou de retirer certains types d’information de la ressource, voire de les stocker dans une ressource externe, indépendante du texte,

mais reliée à celui-ci moyennant les identifieurs (valeurs de l ’attribut « id »). Il est évident qu’au moment où l’annotation ne se limite pas à un seul élément, mais établit une relation entre plusieurs éléments, des stratégies plus complexes sont mises en

oeuvre. Exemple (2) définit la branche d’une structure syntaxique arborescente qui relie deux mots : le mot très (première ligne : noeud terminal, balise « t », adverbe) est attaché au mot grosse (deuxième ligne : noeud non terminal, balise « nt », adjectif).

Cette relation est exprimée par l’attribut « idref » dans la première ligne et spécifiée

par l’attribut « cat » comme Mod[ifieur] :

 

(2) <t mot="très" id="s1_393" idref="s1_394" cat="Mod" morph="ADV" lemme="très"/>

<nt id="s1_394" morph="ADJ" lemme="gros">grosse</nt>

 

Le langage XML, tout en imposant certaines contraintes aux annotateurs, permet donc de représenter les propriétés des éléments individuels aussi bien que les relations entre eux. Il est donc suffisamment expressif pour rendre un grand nombre de

structures linguistiques. Mais les exigences dans le domaine de la standardisation

vont plus loin : XML n ’est qu’un standard technique permettant d’encoder un texte

digitalisé tout comme une banque de données génétique. L ’exemple peut sembler satisfaisant, mais il utilise des attributs et des valeurs arbitraires. La standardisation

du langage XML à l’intérieur d’un domaine d’application est en général confiée à des spécialistes, comme p. ex. ceux du comité ISO/TC 37, où plusieurs groupes de travail

s’occupent de la normalisation terminologique, des schémas d’annotation, des for-mats de représentation pour les différents types de textes ou des banques de données lexicales. Un autre exemple est la TEI (Text Encoding Initiative), qui recommande des

formats XML pour encoder les ressources textuelles. Si les recommandations de la TEI

sont aujourd’hui respectées dans beaucoup de textes digitalisés, il n’en est pas de même pour les ressources linguistiques, où le codage, même en format XML, ne

respecte que rarement les mêmes consignes. Dans l ’exemple, le choix des attributs (mot, morph, lemme, cat) est aussi arbitraire que le choix des valeurs qui forment une liste close, comme les parties de discours (ADV) ou les fonctions grammaticales (Mod). Et ceci pour des raisons évidentes : avec un peu de peine, les linguistes

pourraient peut-être se mettre d ’accord sur le nombre des parties de discours (onze ?), mais qu’en est-il de la terminologie, ou, pire encore, des abréviations utilisées dans

l’annotation ? Sans parler des principes d’analyse (donc : adverbe ou conjonction ? variable en fonction du contexte ou non ?). Et la fonction grammaticale Mod(ifieur)

indique clairement la partie prise pour une analyse syntaxique dépendancielle à la

 

Unauthenticated

Download Date | 5/25/16 3:06 PM

684 Achim Stein

 

Tesnière. La normalisation dans ce domaine, pourvu qu’elle respecte les théories linguistiques et leur évolution, serait donc forcément une tâche interminable, et

vouloir imposer un jeu de catégories aux chercheurs serait probablement une démar-

che vouée à l’échec. Pour la même raison, l’annotation d’une ressource ne peut pas

simplement se traduire : passer d’un jeu de catégories à un autre impliquerait souvent de changer d’approche théorique. Mais dans la recherche il est de bonne coutume de bien définir les catégories et les principes de son analyse. De la même manière, il devrait être normal de tenir compte des catégories déjà existantes, des les réutiliser, ou dans le cas contraire de déclarer et de documenter ses propres catégories publique-

ment. À cette fin, le comité TC 37 mentionné ci-dessus a créé le registre public ISOcat, qui constitue ainsi un forum de rencontre entre la pratique des chercheurs et les

tentatives de normalisation. On peut donc s ’attendre à ce que les ressources devien-nent de plus en plus compatibles sur le plan de l’annotation, tout en gardant leur diversité sur le plan théorique.

 

2.2 Ressources lexicales

 

Tout comme dans le domaine des publications scientifiques, il est normal que les

dictionnaires actuels ainsi qu ’une grande partie des dictionnaires anciens soient disponibles en version digitale. La particularité du domaine lexicographique est la

forme de distribution : si les publications scientifiques sont en général distribuées en un format imprimable (normalement PDF) et permettent la recherche plein texte, les

dictionnaires se présentent en général sous forme de banques de données, interrogea-

bles en ligne ou à l ’intérieur d’une application. Dans les deux cas il se pose la question

de la longévité, car elle dépend de l’entretien du site web ou du support du logiciel, qui doivent rester compatibles avec l’environnement informatique, c’est-à-dire les systèmes d’opération, les navigateurs, et certaines composantes du matériel. La

plupart des maisons d’édition ne font aucun effort pour assurer leur longévité : le passage à une nouvelle version du système d’opération (sans parler du passage entre

des systèmes différents) entraîne souvent la nécessité d’acquérir la nouvelle version. Le problème de la longévité concerne alors le produit vendu, les données linguisti-

ques sont bien entendu précieusement conservées par la maison d’édition. Cette situation n ’est pas critiquable en elle-même, car il s’agit de rentabiliser l’investisse-ment dans la production d’un dictionnaire. Mais d’un point de vue scientifique, il se pose le problème de la non-vérifiabilité et de la non-reproduisibilité des résultats dès

le moment où la ressource est « périmée ». C’est donc aux chercheurs de s’interroger très critiquement sur la spécificité des ressources lexicales sur lesquelles ils/elles fondent leurs travaux.

Le cas où les ressources lexicales sont téléchargeables gratuitement et distribuées en un format ouvert (plein texte, balisage XML etc.) est plus rare. Un tel format

pourrait faciliter un accès aux données plus indépendant des contraintes logicielles et

 

Unauthenticated

Download Date | 5/25/16 3:06 PM

Linguistique française et ressources électroniques 685

 

matérielles. Si l ’utilité des dictionnaires d’usage actuels se heurte à ces obstacles techniques et commerciaux, la mise à disposition des dictionnaires anciens est un

apport important à la linguistique historique, tout comme à d’autres domaines. Les oeuvres qui ont fait époque sont pour la plupart disponibles librement, du Dictiona-

rium latinogallicum d’Estienne jusqu’aux différentes éditions du Dictionnaire de l’Aca-démie française (cf. les sites de l ’ATILF à Nancy ou du projet ARTFL de l’université de Chicago). L’ATILF joue un rôle déterminant dans la distribution des ressources. Son dictionnaire le plus consulté est sans aucun doute la version en ligne du Trésor de la Langue Française (TLFi), mais les dictionnaires des époques antérieures du français

sont tout aussi importants pour la recherche : le Dictionnaire de Moyen Français

(DMF), accompagnée de sa base textuelle, est le résultat d’une des plus grandes

entreprises scientifiques de l ’ATILF, et son infrastructure technique, réalisée par Gilles Souvay, a permis de publier, sur le même site, le Dictionnaire Électronique de Chrétien

de Troyes (DÉCT). D’une certaine manière ces dictionnaires symbolisent aussi le

passage d’une époque de commercialisation à une époque d’ouverture, manifestée par le fait que l’ATILF héberge de plus en plus de ressources librement accessibles.

Si l’utilité des dictionnaires dépend donc surtout du mode et du format de leur distribution, il n’en est pas de même pour les ressources lexicales qui sont issues de et destinées à la recherche linguistique. Ainsi, les études en syntaxique ou en séman-

tique peuvent profiter grandement d’un ouvrage comme Dicovalence (van den Eynde/ Mertens 2010) qui répertorie pour 8334 constructions verbales de plus de 3700 verbes français le nombre, le type et la forme pronominale des arguments, les structures passives, ainsi que les traductions en anglais et en néerlandais. La ressource est en

accès libre, elle est bien documentée, et grâce à son format (un simple fichier texte) elle ne nécessite aucun logiciel de traitement particulier. Les ressources de ce type

sont extrêmement utiles pour le développement des outils linguistiques.

À une échelle beaucoup plus grande, ceci vaut aussi pour Les verbes français

(LVF, Dubois/Dubois-Charlier 1997). Avec des entrées détaillées et semi-formalisées pour plus de 25.600 sens verbaux (de plus de 12.300 verbes), LVF constitue une

ressource qui fait que, pour une fois, le français est mieux décrit que l’anglais, au moins dans ce domaine. La base numérique est un simple tableau en format Excel,

une ligne par construction, les types d’information sont attribués aux colonnes du tableau : lemme, « opérateur » sémantique, domaine, classe sémantique, exemple, construction syntaxique, etc. Ce fichier et une version imprimable sont publiquement

disponibles sur le site de l ’UMR MoDyCo. Son contenu et sa structure sont décrits en plus grand détail dans deux numéros spéciaux de Langages (François/Le Pesant/ Leeman 2007) et de Langue française (Leeman/Sabatier 2011). Ici, il sera plus intér-

essant de voir que la conversion du LVF en un format XML, réalisée par Hadouche/ Lapalme (2010), constitue en effet un enrichissement : elle a permis non seulement

l’installation de la ressource en ligne, sous forme de banque de données interrogeable (sur le site du laboratoire Recherche appliquée en linguistique informatique, RALI, de

l’université de Montréal), mais elle a transformé un fichier texte, statique, en une

 

Unauthenticated

Download Date | 5/25/16 3:06 PM

686 Achim Stein

 

ressource extensible : le balisage XML permet d ’ajouter des informations issues d’au-tres projets de recherche sans nuire à l’intégrité de la ressource d’origine, qui peut être

récupérée à n’importe quel moment. Ce principe est un des grands atouts de ce format, et il est appliqué aux ressources lexicales aussi bien qu’aux corpus, où il

permet soit d’intégrer les différentes couches d’annotation soit de les répertorier dans des fichiers indépendants, reliés par des identifieurs. Cette méthode d’annotation « débarquée » (Loiseau 2007, stand-off annotation) rend les ressources plus mania-bles.

 

2.3 Outils

 

2.3.1 Annotation manuelle et annotation automatique

 

Une annotation suivant les principes mentionnés plus haut peut se faire manuelle-ment, assistée par des éditeurs XML ou des outils spécialement conçus pour des

tâches d’annotation spécialisées (comme p. ex. l’ajout d’une transcription phonétique à un enregistrement). Cette méthode laborieuse est un exemple de « transfert de

l’expertise des locuteurs et des linguistes » (Fuchs/Habert 2001, 4), et l’information

ainsi transférée peut bénéficier à d ’autres recherches linguistiques. Mais puisque ces annotations de haute qualité ne peuvent pas se faire à une échelle plus large, elles

sont en général réservées à des petits corpus spécialisés, comme les corpus histori-ques, ou plus couramment, à des corpus de référence destinés à servir de « standard

d’or » (gold standard) à l’entraînement des outils d’apprentissage automatique. Dans ce qui suit, deux types d’outils seront présentés, pour l’annotation du mot et de la

phrase, respectivement : les étiqueteurs (part of speech taggers), parce que l’étique-tage morphologique est aujourd’hui assez facile à réaliser et parce qu’il permet de mieux cibler les requêtes dans un grand nombre de domaines (morphologie, lexicolo-

gie, syntaxe etc.), et les parseurs syntaxiques (parsers) parce que c ’est un domaine en forte évolution qui fournira des outils performants dans un avenir très proche. Il est

vrai qu’en général, ces outils ont été développés par des informaticiens ou des linguistes computationnels, et très souvent, ils ne seront pas à la portée des linguistes

non spécialisés dans ces domaines. Il s’agira donc d’expliquer les principes et les problèmes de leur fonctionnement ainsi que d ’insister sur leur apport aux recherches en linguistique française. L ’intégration de ces outils spécialisés dans des solutions plus globales sera discutée dans le paragraphe 2.3.5.

 

2.3.2 Analyse morphologique

 

Comme la plupart des domaines du TAL aujoud’hui, l’étiquetage morphologique (part of speech tagging) est largement dominé par les modèles probabilistes, qui peuvent

 

Unauthenticated

Download Date | 5/25/16 3:06 PM

Linguistique française et ressources électroniques 687

 

être basés sur des lexiques ou non. Mais il existe aussi des systèmes basés sur des règles, suivant la méthode de Brill (1992), qui utilisent des règles graphiques et

contextuelles. Puisque l ’analyse d’une graphie présuppose la résolution des ambiguï-tés homographiques (p. ex. entre porte graphie verbale ou nominale), les fonctions de

l’étiquetage et de la lemmatisation sont souvent réunies dans un même outil. TreeTag-ger (Schmid 1994 ; le programme est gratuitement disponible sur son site : CIS,

Universität München) en est un exemple : il utilise un lexique de formes graphiques associées à une étiquette morphologique (et optionnellement à un lemme), ainsi

qu ’un corpus d’entraînement pré-annoté pour apprendre la probabilité contextuelle des étiquettes (p. ex. : à la position X dans le contexte « X-nom-adjectif », un article

est plus probable qu’un verbe). Ces probabilités servent à résoudre les ambiguïtés

mentionnées. TreeTagger est composé de deux programmes : le programme d ’entraî-nement « lit » le corpus d ’entraînement et stocke l’information lexicale et les probabi-lités des catégories dans un fichier de paramètres. Ce processus est en général effectué

par les développeurs qui disposent du corpus d’entraînement. Le deuxième pro-gramme est l’étiqueteur proprement dit : il utilise les paramètres pour transformer un texte brut en ressource annotée (H. Schmid distribue les paramètres pour une quin-

zaine de langues, pour le français cf. Stein/Schmid 1995). Ce processus d’annotation est très rapide, mais il doit être lancé sur la ligne de commande, ce qui peut sembler

rébarbatif aux utilisateurs habitués aux interfaces graphiques. Les formats d’entrée (le texte brut) et de sortie (le texte annoté) sont des fichiers de texte, un mot par ligne,

où le découpage des mots doit être conforme à celui du corpus d ’entraînement. Ce prétraitement exige d’autres compétences de la part des utilisateurs. Certains systè-mes, comme TreeTagger, fournissent des scripts pour ce genre de traitement, mais les textes bruts présentent souvent des particularités qui nécessitent des manipulations

au-delà du simple découpage lexical.

Aux éventuels problèmes pratiques s’ajoutent les problèmes méthodiques. Le hic de tous les outils probabilistes est leur taux d ’erreur : entraînés sur un standard d’or de taille limitée, ils ne seront jamais préparés à tous les contextes imaginables et commettront forcément des erreurs, et les systèmes travaillant avec un lexique tombe-

ront toujours sur des mots inconnus. Les outils se distinguent par les stratégies qu ’ils adoptent pour palier à ce problème des données « non vues », mais un certain taux

d’erreur est inévitable. Certains systèmes peuvent afficher le degré de certitude lorsqu ’ils prennent une décision (p. ex. dans le cas d’une ambiguïté homographique), mais en général ces données ne sont pas incluses dans l ’annotation des corpus. Si une telle ressource annotée est utilisée dans un travail de recherche, il est donc impératif

de prendre connaissance des principes d ’étiquetage et de tenir compte des taux

d’erreurs si on procède à des interprétations quantitatives. Un deuxième problème est le fait que les utilisateurs « passifs », c’est-à-dire ceux qui ne créent pas eux-mêmes

leur corpus d’entraînement, dépendront toujours des paramètres disponibles, qui reposent en grande majorité sur l’analyse d’un langage assez standardisé, souvent des textes de journaux. Ces paramètres contiennent un jeu d’étiquettes prédéfini, ce

 

Unauthenticated

Download Date | 5/25/16 3:06 PM

688 Achim Stein

 

qui force les utilisateurs à adopter les principes d’annotation (et les théories sous-jacentes) du corpus d’entraînement. Si les étiqueteurs produisent des résultats assez

satisfaisants dans l’analyse de la langue standardisée, il n’en est pas de même pour les ressources « non canoniques », comme la langue parlée ou ancienne, et d’une

manière générale pour toutes les variétés qui s ’éloignent de la norme. Pour le moyen français, Gilles Souvay a développé le système LGerm (Souvay/Pierrel 2009). Celui-ci

se base sur les associations entre un lemme et ses graphies d ’une part et sur des règles

flexionnelles de l ’autre. Grâce à LGerm, les utilisateurs peuvent interroger le DMF malgré les variations graphiques, et même en utilisant des formes du français

moderne (cf. paragraphe 2.2).

 

2.3.3 Analyse syntaxique

 

Le deuxième type d’outils présenté ici sont les parseurs syntaxiques. En principe, une structure peut être attribuée à n’importe quelle séquence de mots, mais pour la

plupart des linguistes, l’unité analysée sera la phrase. Là encore, l’analyse peut se baser sur des règles « linguistiques », p. ex. des règles de réécriture : ces parseurs

sont en général moins « robustes », car ils échouent au moment où ils rencontrent des données qui ne correspondent pas à leur « grammaire ». Les ambiguïtés, plus nom-breuses au niveau syntaxique, constituent un autre problème. Pour ces raisons, et

aussi à cause du progrès dans la puissance de calcul, le « marché » est aujourd’hui dominé par les parseurs probabilistes. D ’un point de vue linguistique, le parsing

semble plus intéressant que l ’étiquetage, car l’annotation syntaxique implique une décision pour un modèle de représentation grammaticale. Les relations entre les

éléments (normalement les mots) sont encodées en graphes, et ces graphes peuvent représenter les modèles à constituants aussi bien que les modèles dépendanciels

(sans mentionner les différentes théories qui utilisent ces graphes). Il existe des parseurs pour les deux, bien que les modèles dépendanciels sembleraient avoir pris

le devant récemment, entre autres parce qu’ils présentent des avantages dans le traitement des langues à ordre des mots libre. Ceci a créé un certain écart entre les études syntaxiques théoriques et typologiques, assez solidement ancrées dans le

modèle à constituants de la grammaire générative, et le TAL, qui penche vers les structures plus légères du modèle dépendanciel. Cet écart se manifeste également

entre les ressources actuelles, souvent dépendancielles, et les « dinosaures » parmi

les banques d’arbres créés à l’université de Pennsylvanie au début des années 1990, comme le Wall Street Journal, qui ont permis de développer et d ’évaluer un grand

nombre d’outils TAL. La seule banque d’arbres disponible pour le français moderne est la French Treebank (Abeillé/Barrier 2004). Elle contient 12.531 phrases de Le

Monde, avec une annotation morphologique et syntaxique. Sa conversion en banque dépendancielle et des expériences avec un parseur dépendanciel ont été réalisées par

Candito/Crabbé/Denis (2010).

 

Unauthenticated

Download Date | 5/25/16 3:06 PM

Linguistique française et ressources électroniques 689

 

Les parseurs sont forcément plus complexes que les étiqueteurs : les informations traitées sont lexicales (partie de discours) aussi bien que configurationnelles (ordre

des mots). Car l ’analyse syntaxique se greffe en général sur une analyse lexicale, souvent incluse dans les systèmes. L ’exemple présenté ici sont les outils mate (mate tools, Bohnet 2010), gratuitement disponibles sur le site de Google Code. Ils incluent entre autre un étiqueteur et un parseur dépendanciel, ainsi que des paramètres pour

l’anglais, l’allemand et le français. Le principe d’entraînement est le même que celui

de l’étiqueteur probabiliste, mais plus complexe, car les probabilités doivent être calculées pour chaque arc de tous les graphes représentant une structure dépendan-

cielle, tout en incluant les informations lexicales. Le graphe qui réunit les probabilités

les plus élevées est retenu comme analyse. Ce processus d’entraînement est coûteux : il se fera normalement dans un environnement où plusieurs processeurs travaillent en parallèle. Il en résulte des paramètres pour la morphologie, la lemmatisation (si

présente dans le corpus d ’entraînement) et les relations dépendancielles. Tout comme

avec l’étiqueteur présenté dans le paragraphe 2.3.2, la partie « analyse » est une tâche plus légère qui peut être exécutée sur un ordinateur de bureau normal. Le format de

sortie est également un format textuel composé de onze colonnes (cf. CoNLL-2009 Shared Task : Syntactic and Semantic Dependencies in Multiple Languages) dont les

plus importantes sont celle qui répertorie les dépendances entre les nœuds, c’est-à-dire les mots dans un modèle dépendanciel, et celle qui attribue une fonction gram-maticale (sujet, objet, etc.) à cette relation.

Dans le cas de l’annotation syntaxique il est plus difficile de s’imaginer qu’elle soit d ’un intérêt général, puisque l’analyse morphologique est souvent suffisante pour résoudre les ambiguïtés lexicales. En plus, la complexité des parseurs et leurs exigen-ces matérielles, au moins pour la partie entraînement, laissent supposer que peu de

linguistes théoriques annotent leurs ressources syntaxiquement. Le fonctionnement

des parseurs a été présenté en plus grand détail tout d’abord parce que les premiers corpus syntaxiquement annotés ont été publiés récemment (cf. paragraphe 2.3.4), mais aussi parce que les nouvelles « plateformes » linguistiques vont permettre un accès beaucoup plus facile à ces outils (cf. paragraphe 2.3.5).

 

2.3.4 Exemple : deux corpus annotés pour l ’ancien français

 

La différence entre les modèles syntaxiques mentionnée plus haut (2.3.3) est exem-plifiée par les deux premiers corpus du français historique qui sont syntaxiquement annotés, MCVF et SRCMF. Le corpus MCVF (Modéliser le changement, les voies du

français, Martineau 2009) a été publié par l’université d’Ottawa. Il s’agit d’un corpus diachronique contenant des textes entre le XIe e et le XVIII siècle avec un total de plus

d’un million de mots. L’époque de l’ancien français (avant 1350) est représentée par treize textes contenant 361.283 mots, ce qui équivaut à 23.558 phrases dans la version

syntaxiquement annotée. SRCMF (Syntactic Reference Corpus of Medieval French,

 

Unauthenticated

Download Date | 5/25/16 3:06 PM

690 Achim Stein

 

Prévost/Stein 2013) est issu de la coopération de l’ENS de Lyon avec l’université de Stuttgart, financée par l’ANR et la DFG. Le corpus contient 266.383 mots en 24.173 phrases annotées et revues manuellement suivant un modèle dépendanciel. MCVF et SRCMF sont disponibles gratuitement.

Les différences entre les deux corpus montrent bien l’imbrication intime entre la méthodologie employée pour la création des corpus et leur utilité pour la recherche

linguistique où la disponibilité des méthodes et des ressources est d ’une importance cruciale. MCVF est sans aucun doute le plus grand corpus français diachronique syntaxiquement annoté. Cependant, les particularités de la méthodologie et des outils

d’annotation font que le corpus n’est pas extensible : il est vrai que les étiquettes de l’annotation sont bien documentées, mais les principes et les choix de leur attribution

le sont moins, et les outils d’annotation (étiqueteur, parseur) ne sont ni documentés ni accessibles. Par conséquent il est quasiment impossible d’augmenter le corpus suivant la même méthodologie, ne serait-ce que pour remédier au problème inévitable de sa représentativité, p. ex., puisque les lacunes ne pourront pas être comblées par des textes analysés de la même manière. La comparaison directe de deux ressources

comme MCVF et SRCMF est quelque part injuste, car les points critiques qui viennent

d’être relevés s’expliquent par le fait que les méthodes mises en oeuvre pour créer MCVF sont celles qui avaient été développées dans les années 1990 pour la création

des corpus de l’ancien et du moyen anglais à l’université de Pennsylvanie, inspirées par les banques d’arbres mentionnées plus haut, et donc bien avant la publication de

la première version de XML (en 1998). Sans la coopération avec l ’université de Pennsylvanie, l ’annotation syntaxique de MCVF (qui bien entendu ne représente

qu ’une partie de cet impressionnant projet GTRC réalisé à l’université d’Ottawa) n’aurait probablement pas vu le jour, mais en revanche elle n’aurait alors pas hérité

des déficits inhérents à son format : il s’agit d’un format plein texte, où les consti-tuants sont marqués par des parenthèses, et qui ne peut être interrogé que par des

outils spécialement conçus pour ce format, comme CorpusSearch (cf. la documenta-

tion à la page Penn Corpora of Historical English sur le site web de l’université de Pennsylvanie). Il faut ajouter que pour des raisons pratiques une grande partie des

linguistes qui travaillent avec les banques d’arbres dans ce format opteraient proba-blement pour ce standard de facto, et non pour un standard basé sur un balisage XML.

Et enfin, il est tout à fait possible de convertir les données, pourvu que la licence de la ressource le permette. Le cas du MCVF montre que la recherche linguistique actuelle,

au moins celle qui aboutit à des résultats « palpables » et opte pour la publication et

la distribution de ces ressources, ne peut contourner certaines questions d ’ordre technique.

Le projet SRCMF, lancé en 2009, a pu profiter de ces expériences. Il se distingue

du corpus MCVF en premier lieu par le choix d ’un modèle grammatical différent, inspiré par la grammaire dépendancielle de Tesnière (par opposition au modèle à constituants du MCVF). Cette décision avait été prise surtout pour des raisons linguis-

tiques d ’une part, mais l’idée d’une utilisation ultérieure pour entraîner un parseur

 

Unauthenticated

Download Date | 5/25/16 3:06 PM

Linguistique française et ressources électroniques 691

 

dépendanciel avait également joué un rôle dans ces considérations. Concernant les

principes d’annotation et la longévité des ressources discutés dans le paragraphe 2.2,

le projet SRCMF a essayé d’adopter la voie d’une ouverture et d’une accessibilité maximale : en dehors d’une documentation explicite des principes d’annotation

(donc de la partie linguistique du projet), l’annotation syntaxique est encodée en un format ouvert et bien défini (RDF/XML), le processus d ’annotation se fait moyennant le logiciel NotaBene (Mazziotta 2010a ; 2010b), qui est gratuitement disponible et qui

assure l’export en deux autres formats : TigerXML, qui permet d’exploiter le corpus avec l’outil TigerSearch (également gratuit) et CoNLL, qui permet d’entraîner des parseurs dépendanciels (cf. paragraphe 2.3.3). Cette démarche est censée faciliter

l’agrandissement du corpus, et elle est actuellement appliquée à la collection des Plus anciens documents linguistiques de la France (DocLing, cf. Gleßgen 2003) qui recevront une annotation syntaxique suivant le même modèle.

 

2.3.5 Les méta-outils : plateformes et portails

 

La standardisation des formats des ressources textuelles a sans doute atténué les

problèmes créés par la digitalisation des ressources linguistiques. Mais la grande

majorité de la génération actuelle n’a pas bénéficié d’une formation informatique, et même aujourd’hui la formation de la nouvelle génération de linguistes ne transmet que très exceptionnellement ces connaissances. Par conséquent, la manipulation

d’un fichier texte en dehors d’un système de traitement de texte (qui n’aurait de toute

façon pas les capacités nécessaires) ou la création d ’un fichier XML dans un éditeur XML sont des tâches qui ne relèvent pas de la compétence des linguistes théoriques,

non spécialisés dans les corpus ou le TAL. Or, l’utilisation des ressources digitalisées est tellement devenue monnaie courante que le besoin de fonder ses recherches sur

des données empiriques même dans les domaines plus théoriques devient de plus en plus pressant. Deux tendances récentes peuvent être considérées comme réponses à cette situation.

La première solution consiste à « envelopper » les outils individuels et peu conviviaux dans un environnement facilitant leur gestion, une sorte de plateforme

informatique. La plateforme TXM (Heiden/Magué/Pincemin 2010) a été développée dans le projet ANR Textométrie dans le but de réunir en un seul environnement les

techniques pour la gestion de grands corpus et pour faciliter les analyses statistiques

des données textuelles. Elle a été créée dans l’esprit de l’open source : non seulement elle est disponible librement et gratuitement, mais elle est conçue pour l ’intégration

d’autres outils linguistiques qui sont distribués dans cet esprit (pour plus d’informa-tion et le lien d’accès au portail « TXM pour le web » cf. le site Textométrie de l’ENS de Lyon). Les possibilités offertes par TXM ne seront décrites que de façon sommaire ici, mais pour les linguistes théoriques il est probablement de première importance que le

logiciel – contrairement à d’autres produits issus de la recherche en TAL – soit très

 

Unauthenticated

Download Date | 5/25/16 3:06 PM

692 Achim Stein

 

bien documenté et que les développeurs ainsi que les utilisateurs partagent leurs

expériences. TXM offre un mode d’emploi en ligne ou téléchargeable, des vidéos, un wiki et une liste de diffusion. Une fois installé, le programme permet non seulement

d’importer des textes et d’effectuer des recherches, mais aussi – si les utilisateurs le

désirent – de les annoter en intégrant d’autres outils, de visualiser les résultats des requêtes ainsi que de les soumettre à des analyses statistiques. L’utilisation minimale, la recherche dans les corpus, est à la portée de tous les utilisateurs. La possibilité de

gérer des outils d’annotation permet de créer une ressource enrichie à l’intérieur de la plateforme, sans être obligé de lancer « manuellement » les programmes, c ’est-à-dire

sans utiliser la ligne de commande. Ainsi, il est facile d’ajouter des étiquettes morpho-logiques ou des lemmes à son corpus (cf. étiquetage morphologique, paragraphe

2.3.2), et ce processus est bien documenté. Par rapport à d’autres logiciels issus de la recherche, TXM présente par ailleurs l’avantage d’être conçu par une équipe française qui accorde une certaine préférence à l ’explication du traitement des ressources

françaises (dans la documentation, p. ex.). Même si tous les utilisateurs ne s ’intéres-sent pas à l’exploitation statistique des résultats, qui est évidemment l’objectif princi-

pal d ’un outil textométrique, l’utilisation d’une telle plateforme TXM est un progrès énorme du point de vue des linguistes, car elle facilite grandement la manipulation

des corpus et des outils de corpus qui n’étaient accessibles qu’à la minorité des chercheurs qui acceptaient de consacrer une partie considérable de leur temps à se

former dans ce domaine spécialisé. Toujours est-il qu ’il reste des inconvénients :

l’installation (bien qu’automatisée) du logiciel, sa configuration, la lecture d’au moins une partie de la documentation, sans oublier la gestion des données sur son ordina-

teur.

La deuxième solution est également une sorte de plateforme, mais elle va plus

loin dans la mesure où elle remplace l’utilisation locale des logiciels par des services en ligne. Cette démarche est déjà bien établie dans d’autres domaines (logiciels bureautiques, stockage des données etc.), et l ’Union Européenne a lancé l’initiative

CLARIN (Common Language Resources and Technology Infrastructure) pour l’établir dans le domaine de la linguistique. Ceci n’est pas le seul objectif de CLARIN : les chercheurs en linguistique bénéficieront aussi du virtual language observatory, réper-toriant les ressources disponibles pour différentes langues (9.542 ressources en fran-

çais, chiffre relevé le 9.2.2014). Un des résultats est la plateforme virtuelle Weblicht (Web-based Linguistic Chaining Tool). Sa conception ressemble à celui de TXM : en

peu de mots, Weblicht est destiné à faciliter le travail des linguistes en proposant

l’utilisation en ligne d’un grand nombre d’outils pour différentes langues. Dans la perspective des utilisateurs, la plateforme se présente ainsi : le premier pas est le

téléchargement du texte. Weblicht analysera alors le texte et proposera tous les outils qui correspondent à son profil. Le résultat dépendra entre autres de la langue, mais

aussi du format et des informations déjà présentes dans la ressource. Pour un texte brut (non annoté), le premier outil sera un « tokeniseur » capable de découper le texte

en entités analysables (en mots, p. ex.). Si cet outil est accepté, Weblicht proposera

 

Unauthenticated

Download Date | 5/25/16 3:06 PM

Linguistique française et ressources électroniques 693

 

d’autres outils d’analyse pour le niveau lexical, p. ex. des étiqueteurs ou des lemmati-seurs. Parfois, il sera possible (ou nécessaire) de choisir entre plusieurs outils qui sont

disponibles pour exécuter une même tâche. Au niveau suivant, après l’étiquetage morphologique, Weblicht pourra proposer un parseur dépendanciel pour ajouter une

structure syntaxique, et ainsi de suite. Les couches de traitement qui pourraient suivre, sont la sémantique (désambiguïsation de mots, résolution des anaphores), la

reconnaissance des mots propres, l’alignement des mots ou des phrases dans des corpus parallèles (traductions), etc., suivant la disponibilité des outils, qui, évidem-ment, varie selon la langue de la ressource. De cette manière, et guidés par une

interface graphique conviviale (et par leurs besoins), les utilisateurs créent une chaîne

de traitement pour leur texte, composée d ’un ou de plusieurs de ces outils, et finissent par lancer le traitement en cliquant sur un seul bouton. Le processus technique du traitement sera alors distribué sur les serveurs fournis par le réseau des partenaires

CLARIN, et ceci présente un autre avantage : il est ainsi possible de bénéficier d’un

outil même s’il est trop puissant ou trop coûteux pour tourner sur un ordinateur de bureau, puisqu’aucune installation n’est nécessaire. Et parfois même les experts en

TAL peuvent être surpris par l ’existence d’outils qui n’ont été mis à disposition que récemment. Bref, les plateformes en ligne sont proches d’une solution de rêve au problème qui nous intéressait : l’écart entre la compétence et le besoin des linguistes

dans le domaine spécialisé du TAL. Pourtant, au moins dans l’état de développement actuel de Weblicht, et considérée du point de vue technique, mais parfois aussi de

celui du droit propriétaire, cette méthode présente l’inconvénient d’impliquer le transfert des données à un site virtuel pour les faire traiter. Et après le traitement il se

posera toujours la question de son utilisation ultérieure : les requêtes et l’interpréta-tion de leurs résultats devront se faire en local. Mais on peut supposer que les outils

d’exploitation feront bientôt partie de ces services, et il est vrai que les deux projets présentés ici, Textométrie et Weblicht se rapprochent dans la mesure où TXM permet

d’être installé sur un serveur et pourrait donc proposer ces services d’exploitation en ligne (cf. la version de démonstration sur le site du projet).

 

3 Conclusion

 

Somme toute faite, l ’état de l’art concernant les ressources et les outils permettant leur exploitation pour la recherche linguistique a considérablement avancé pendant ces dernières années. Cette contribution a présenté un choix de ressources qui intéressent surtout la linguistique française, elle a retenu deux tendances générales comme étant

particulièrement importantes : le développement des « méta-outils », qui facilitent la

gestion des données et l’utilisation de certains logiciels TAL spécialisés, et la mise en place des services en ligne qui permettent aux chercheurs de produire une ressource annotée indépendamment de toute installation locale. Ces développements récents

pourraient agrandir la portée des outils et des ressources électroniques et ainsi

 

Unauthenticated

Download Date | 5/25/16 3:06 PM

694 Achim Stein

 

contribuer à combler le fossé qui s ’est formé entre la linguistique traditionnelle et la linguistique computationnelle.

 

4 Bibliographie

 

Abeillé, Anne/Barrier, Nicolas (2004), Enriching a French Treebank, in : Nicoletta Calzolari et al. (edd.),

4th international conference on language resources and evaluation LREC (Lisbon, 26 may–

28 may 2004), http://www.lrec-conf.org/proceedings/lrec2004/pdf/562.pdf. Bohnet, Bernd (2010), Top Accuracy and Fast Dependency Parsing is not a Contradiction, in : Chu-Ren

Huang/Dan Jurafsky (edd.), Proceedings of the 23rd International Conference on Computational

Linguistics (Coling 2010), Beijing, Coling 2010 Organizing Committee, 89 –97. Brill, Eric (1992), A Simple Rule-based Part of Speech Tagger, in : Proceedings of the Third Conference

on Applied Natural Language Processing (ANLC 1992), Stroudsburg, Association for Computatio-

nal Linguistics, 152–155.

Candito, Marie/Crabbé, Benoît/Denis, Pascal (2010), Statistical French dependency parsing : treebank

conversion and first results, in : Proceedings of LREC ’2010, La Valletta, http://researchers.lille.

inria.fr/~pdenis/papers/lrec10dep.pdf (24.04.2015).

Dubois, Jean/Dubois-Charlier, Françoise (1997), Les verbes français, Paris, Larousse. Fillmore, Charles (1992), « Corpus linguistics » or « Computer-aided armchair linguistics », in :

Jan Svartvik (ed.), Directions in Corpus Linguistics, Berlin/New York, Mouton de Gruyter, 35 –60. François, Jacques/Le Pesant, Denis/Leeman, Danielle (2007), Présentation de la classification des

Verbes Français de Jean Dubois et Françoise Dubois-Charlier, Langue Française 153, 3–19. Fuchs, Catherine/Habert, Benoît (2001), Le traitement automatique des langues, Paris, PUF. Gleßgen, Martin-Dietrich (2003), L’élaboration philologique et l’étude lexicologique des « Plus an-

ciens Documents linguistiques de la France » à l’aide de l’informatique, in : Frédéric Duval (ed.),

Actes du X e colloque international sur le moyen français (12–14 juin 2000, Metz), Paris, École des

Chartes, 371–386.

Hadouche, Fadila/Lapalme, Guy (2010), Une version électronique du LVF comparée avec d’autres

ressources lexicales, Langages 179–180, 193–220. Heiden, Serge/Magué, Jean-Philippe/Pincemin, Bénédicte (2010), TXM : Une plateforme logicielle

open-source pour la textométrie – conception et développement, in : Sergio Bolasco/Isabella

Chiari/Luca Giuliano (edd.), Statistical Analysis of Textual Data-Proceedings of 10th International

Conference JADT 2010, Rome, 9–11 juin 2010, Rome, Edizioni Universitarie de Lettere Exonomia

Diritto, 2 (3), 1021–1032.

Leeman, Danielle/Sabatier, Paul (2011), Empirie, théorie, exploitation : le travail de Jean Dubois sur les

verbes français, Paris, Larousse/Colin. Loiseau, Sylvain (2007), CorpusReader : un dispositif de codage pour articuler une pluralité d’inter-

prétations, Corpus 7, 153 –186.

Martineau, France (2009), Le corpus MCVF. Modéliser le changement : les voies du français, Ottawa,

Université d’Ottawa.

Mazziotta, Nicolas (2010a), Logiciel NotaBene pour l ’annotation linguistique. Annotations et concep-

tualisations multiples, Recherches qualitatives. Hors-série « Les actes » 9, 83–94. Mazziotta, Nicolas (2010b), Building the « Syntactic Reference Corpus of Medieval French » Using

NotaBene RDF Annotation Tool, in : Association for Computational Linguistics (ed.), Proceedings

of the 4th Linguistic Annotation Workshop (LAW IV), 142 –146. Prévost, Sophie/Stein, Achim (2013), Syntactic Reference Corpus of Medieval French, Lyon/Stuttgart/

Paris, ENS de Lyon/Lattice/Universität Stuttgart.

 

Unauthenticated

Download Date | 5/25/16 3:06 PM

Linguistique française et ressources électroniques 695

 

Schmid, Helmut (1994), Probabilistic Part-of-Speech Tagging using Decision Trees, in : Daniel Jones

(ed.), Proceedings of the International Conference on New Methods in Language Processing

(NeMLaP’94), Manchester September 1994, Manchester, UMIST, 44–49. Souvay, Gilles/Pierrel, Jean-Marie (2009), LGeRM : lemmatization of Middle French words. Traitement

automatique des langues 50:2, 149–172.

Stein, Achim/Schmid, Helmut (1995), Étiquetage morphologique de textes français avec un arbre de

décisions, Traitement automatique des langues 36:1–2 : Traitements probabilistes et corpus,

23–35.

van den Eynde, Karel/Mertens, Piet (2010), Dicovalence. Dictionnaire de valence des verbes français,

Version 2.0, Leuven, University of Leuven, http://bach.arts.kuleuven.be/dicovalence/

(09.02.2014).

 

Unauthenticated

Download Date | 5/25/16 3:06 PM