{"id":580,"date":"2018-09-07T16:30:00","date_gmt":"2018-09-07T15:30:00","guid":{"rendered":"http:\/\/presto.ens-lyon.fr\/?page_id=580"},"modified":"2018-09-17T17:45:24","modified_gmt":"2018-09-17T16:45:24","slug":"principes-de-constitution","status":"publish","type":"page","link":"https:\/\/presto.ens-lyon.fr\/?page_id=580","title":{"rendered":"Principes de constitution"},"content":{"rendered":"<div style=\"border: 1px solid black; padding: 0 1em\">\n<p>Ce document est publi\u00e9 librement sur le web \u00e0 destination de la communaut\u00e9 scientifique dans le cadre de la licence Creative Commons \u00ab Paternit\u00e9-Pas d&rsquo;Utilisation Commerciale-Partage des Conditions Initiales \u00e0 l&rsquo;Identique 2.0 France \u00bb. En accord avec cette licence, si vous utilisez ce document dans vos travaux, vous \u00eates pri\u00e9 de mentionner sa r\u00e9f\u00e9rence (Programme PRESTO, titre, auteur(s), lien URL).<\/p>\n<p>\t<a href=\"http:\/\/presto.ens-lyon.fr\/wp-content\/uploads\/2014\/05\/ccbyncsa.png\"><img loading=\"lazy\" decoding=\"async\" class=\"aligncenter size-full wp-image-500\" src=\"http:\/\/presto.ens-lyon.fr\/wp-content\/uploads\/2014\/05\/ccbyncsa.png\" alt=\"CC-by-nc-sa\" width=\"88\" height=\"31\" \/><\/a>\n<\/div>\n<div>\n<p style=\"text-align: center;\">\n\t\tR\u00e9daction\u00a0: Denis Vigier<br \/>\n\t\t<a href=\"http:\/\/www.icar.cnrs.fr\/membre\/dvigier\">http:\/\/www.icar.cnrs.fr\/membre\/dvigier<\/a><br \/>\n\t\t<a href=\"mailto:\/\/denis.vigier@ens-lyon.fr\">denis.vigier@ens-lyon.fr<\/a>\n\t<\/p>\n<\/div>\n<h2>Principes de constitution d\u2019un corpus historique appliqu\u00e9s \u00e0 PRESTO<\/h2>\n<h3>1. D\u00e9finir la population cible<\/h3>\n<p align=\"justify\">D\u00e9finir explicitement la population cible constitue la premi\u00e8re \u00e9tape de toute constitution de corpus.<\/p>\n<p align=\"justify\"><b>Les fronti\u00e8res temporelles<\/b> pour commencer : pour ce qui concerne Presto, la borne temporelle initiale d\u00e9finie est 1500 (borne \u00ab arithm\u00e9tique \u00bb du d\u00e9but du XVI<sup>e<\/sup> s.), la borne finale 1944 &#8211; celle-ci ayant \u00e9t\u00e9 d\u00e9finie en fonction de la p\u00e9riode de soixante-dix ans pendant laquelle courent les droits d\u2019auteurs avant que l\u2019\u0153uvre ne monte dans le domaine public<sup><a class=\"sdfootnoteanc\" href=\"#sdfootnote1sym\" name=\"sdfootnote1anc\">1<\/a><\/sup>.<\/p>\n<p align=\"justify\"><b>Quelle population cible<\/b> un corpus historique vise-t-il ? L\u2019id\u00e9e de repr\u00e9senter la langue prise dans sa globalit\u00e9 serait une douce et folle utopie\u2026 Elle se heurte de plein fouet \u00e0 une difficult\u00e9 consid\u00e9rable que tous les diachroniciens<sup><a class=\"sdfootnoteanc\" href=\"#sdfootnote2sym\" name=\"sdfootnote2anc\">2<\/a><\/sup> connaissent bien : plus on s\u2019\u00e9loigne de la p\u00e9riode contemporaine, plus les donn\u00e9es (ou les traces) linguistiques accessibles se font rares. L\u2019oral n\u2019a laiss\u00e9 quasiment aucune trace (sinon par sa \u00ab repr\u00e9sentation \u00bb dans les \u00e9crits, essentiellement litt\u00e9raires), les productions langagi\u00e8res des locuteurs analphab\u00e8tes ou peu lettr\u00e9s nous sont parfaitement inconnues, la vari\u00e9t\u00e9 des genres accessibles d\u00e9cro\u00eet (et l\u2019on sait que, pour les p\u00e9riodes les plus recul\u00e9es, tous ne nous ont pas \u00e9t\u00e9 transmis), etc. Comme l\u2019\u00e9crit R.-A. Lodge, \u00ab les donn\u00e9es linguistiques parvenues jusqu\u2019\u00e0 nous des \u00e9poques r\u00e9volues sont rarement celles que le linguiste aurait choisies, laiss\u00e9 \u00e0 lui-m\u00eame : elles survivent de mani\u00e8re fortuite, elles sont fragmentaires et loin d\u2019\u00eatre repr\u00e9sentatives de tous les registres de la langue, et, surtout, elles sont \u00e9crites et non orales \u00bb (2009 : 211). C. <span lang=\"en-GB\">Claridge (2008 : 247) fait le m\u00eame constat:<\/span> \u00ab <span lang=\"en-GB\"><i>the texts transmitted to the present represent a random subsample of the whole population, due to largely extra-linguistic accidents. Thus, historical corpora can never even remotely capture the full variety of language<\/i><\/span> \u00bb<span lang=\"en-GB\"><i>.<\/i> <\/span>Autrement dit, il appara\u00eet exclu que les concepteurs d\u2019un corpus historique d\u00e9cid\u00e9s \u00e0 \u00e9chantillonner des textes relevant d\u2019un \u00e9tat de langue ancien puissent se fixer comme population cible la langue <i>telle qu\u2019elle \u00e9tait pratiqu\u00e9e par les locuteurs du temps<\/i>. La population des \u00e9v\u00e9nements langagiers vis\u00e9s par un corpus historique se r\u00e9duit n\u00e9cessairement (et \u00ab asymptotiquement \u00bb pourrait-on dire) \u00e0 la somme des \u00ab traces \u00bb linguistiques qui nous en ont \u00e9t\u00e9 transmises. Etudier par ex. le genre de la conversation en fran\u00e7ais pr\u00e9classique \u00e9quivaudrait, en terme de population, \u00e0 cibler l\u2019ensemble des textes qui nous disent aujourd\u2019hui quelque chose des conversations de cette \u00e9poque. Cette limite formul\u00e9e, la question de la repr\u00e9sentativit\u00e9 se pose sous un jour  diff\u00e9rent que pr\u00e9c\u00e9demment nous semble-t-il. Ce que l\u2019on cherche \u00e0 repr\u00e9senter en linguistique historique, ce n\u2019est pas une population d\u2019\u00e9v\u00e9nements langagiers par essence infinie comme c\u2019est le cas pour une langue contemporaine<sup><a class=\"sdfootnoteanc\" href=\"#sdfootnote3sym\" name=\"sdfootnote3anc\">3<\/a><\/sup> mais seulement les traces (en nombre n\u00e9cessairement fini) d\u2019une population d\u2019\u00e9v\u00e9nements langagiers donn\u00e9s. Bref, s\u2019il y a repr\u00e9sentativit\u00e9, ce ne peut \u00eatre que des traces\u2026 Nous sommes donc r\u00e9serv\u00e9 vis-\u00e0-vis des propos de S. Pr\u00e9vost (2015) pour qui repr\u00e9senter de la mani\u00e8re aussi proche que possible \u00ab des \u00e9tats de langue successifs que nous savons avoir exist\u00e9 \u00bb demeure en linguistique historique \u00ab un <i>id\u00e9al<\/i> vers lequel il faut tendre \u00bb (\u00a7 29). Cet id\u00e9al nous semble plut\u00f4t devoir \u00eatre de repr\u00e9senter le plus fid\u00e8lement les <i>traces<\/i> que nous avons conserv\u00e9es de ces \u00e9tats de langue.<\/p>\n<p align=\"justify\"><b>La d\u00e9finition op\u00e9rationnelle<\/b> de la population cible, quant \u00e0 elle, met en jeu pour chaque strate identifi\u00e9e une liste des textes candidats \u00e0 figurer dans l\u2019\u00e9chantillon, liste que l\u2019on soumet \u00e0 un tirage al\u00e9atoire \u2013 du moins lorsque le nombre de textes disponibles le permet\u2026 La confection d\u2019une telle liste engage, dans le cas des corpus historiques, la question de la datation du texte. \u00ab <span lang=\"en-US\"><i>The date of the sampled text is of great importance with regard to the time frame and the internal sub-periods.<\/i> <\/span><i>\u00bb<\/i> (C. Claridge, <i>op. cit<\/i>. : 244).<i><\/i> Choisit-on la date de la premi\u00e8re \u00e9dition ou bien la date (approximative souvent, et sous r\u00e9serve qu\u2019elle soit connue) du manuscrit ? Les pratiques des bases textuelles diff\u00e8rent \u00e0 cet \u00e9gard. La BFM (<span style=\"color: #333399;\"><a href=\"http:\/\/bfm.ens-lyon.fr\/\">http:\/\/bfm.ens-lyon.fr<\/a><\/span>) par exemple a choisi d\u2019affecter aux \u0153uvres qu\u2019elle met en ligne la date de composition du manuscrit (connue ou estim\u00e9e)<sup><a class=\"sdfootnoteanc\" href=\"#sdfootnote4sym\" name=\"sdfootnote4anc\">4<\/a><\/sup>. Les biblioth\u00e8ques virtuelles humanistes (BVH http:\/\/www.bvh.univ-tours.fr) ainsi que Frantext (http:\/\/www.frantext.fr) \u2013 bases avec lesquelles nous avons le plus souvent travaill\u00e9 pour Presto \u2013 utilisent le plus souvent la date d\u2019\u00e9dition originale de l\u2019\u0153uvre. Dans le corpus Presto, c\u2019est ce principe que nous avons choisi<sup><a class=\"sdfootnoteanc\" href=\"#sdfootnote5sym\" name=\"sdfootnote5anc\">5<\/a><\/sup>. Il demeure cependant que faute de temps, nous avons repris sans syst\u00e9matiquement les v\u00e9rifier les dates d\u2019\u00e9dition originales fournies par ces bases pour les textes qu\u2019ils nous ont communiqu\u00e9s. Ce travail reste donc \u00e0 accomplir.<\/p>\n<p align=\"justify\">Un dernier point, qui touche \u00e0 la <b>qualit\u00e9 philologique des textes<\/b> doit \u00eatre ici \u00e9voqu\u00e9. Dans Presto \u2013 comme dans toute entreprise de constitution d\u2019un corpus historique \u2013 la qualit\u00e9 des \u00e9ditions utilis\u00e9es est primordiale. En particulier, lorsque nous ne disposions pas de l\u2019\u00e9dition originale pour une \u0153uvre donn\u00e9e, nous avons cherch\u00e9 \u00e0 s\u00e9lectionner un exemplaire dont l\u2019\u00e9dition s\u2019approchait le plus de cette derni\u00e8re, notamment pour ce qui regardait la ponctuation, l\u2019orthographe et la graphie. Comme l\u2019\u00e9crivent C. Guillot, S. Heiden, A. Lavrentiev &amp; C. Marchello-Nizia (<i>op. cit.<\/i>) \u00e0 propos des textes m\u00e9di\u00e9vaux :<\/p>\n<p align=\"justify\">\u00ab il existe (\u2026) des crit\u00e8res qui pr\u00e9sident \u00e0 une s\u00e9lection raisonn\u00e9e des textes \u00e0 num\u00e9riser pour les inclure dans un corpus. L\u2019un des crit\u00e8res pris en compte presque syst\u00e9matiquement est  la \u00ab qualit\u00e9 philologique \u00bb des textes \u00ab papier \u00bb : qualit\u00e9 des \u00e9ditions choisies (fond\u00e9es sur un manuscrit lui-m\u00eame bien choisi, que l\u2019\u00e9diteur suit le plus fid\u00e8lement possible sans trop le \u00ab corriger \u00bb ou l\u2019 \u00ab amender \u00bb), mais aussi finesse de leur description (\u2026) \u00bb<\/p>\n<h3>2. Raret\u00e9 et caract\u00e8re parcellaire des \u00ab traces \u00bb linguistiques transmises jusqu\u2019\u00e0 nous pour les \u00e9tats les plus anciens de la langue<\/h3>\n<p align=\"justify\">Nous avons point\u00e9 <i>supra<\/i> le caract\u00e8re parcellaire des donn\u00e9es linguistiques accessibles pour des \u00e9tats anciens de la langue, qui interdit toute ambition de repr\u00e9sentativit\u00e9 de la langue telle qu\u2019elle \u00e9tait pratiqu\u00e9e. Pr\u00e9cisons notre propos. D\u2019abord, ces donn\u00e9es sont \u00e9crites (lorsqu\u2019on travaille sur des \u00e9tats de la langue ant\u00e9rieurs aux proc\u00e9d\u00e9s techniques d\u2019enregistrement sonore), les traces sonores ne pouvant pas \u00eatre fix\u00e9es sur un support (sinon cas de transcription). D\u2019o\u00f9 toute une cascade de biais<sup><a class=\"sdfootnoteanc\" href=\"#sdfootnote6sym\" name=\"sdfootnote6anc\">6<\/a><\/sup>, puisque cette absence d\u2019oral oblit\u00e8re non seulement l\u2019acc\u00e8s aux vari\u00e9t\u00e9s populaires mais aussi \u00e0 des couches de la soci\u00e9t\u00e9 marginalis\u00e9es pour des raisons de genre sexu\u00e9 (les femmes), d\u2019\u00e2ge (les enfants) etc. De surcro\u00eet, plus on s\u2019\u00e9loigne dans le pass\u00e9, plus la conservation de ces traces \u00e9crites a \u00e9t\u00e9 soumise au hasard. Et m\u00eame si, au cours du temps se sont maintenus quelques processus de conservation intentionnels (archivage institutionnel, conservation de documents dans le cadre familial, \u2026), ce qui a \u00e9t\u00e9 conserv\u00e9 n\u2019a souvent rien \u00e0 voir avec les objectifs qui animent le chercheur. En d\u2019autres termes, comme le dit non sans humour W. Labov (1994 :11) : \u00ab <i>Historical linguistics can then be thought of as the art of making the best use of bad data<\/i> \u00bb.<\/p>\n<h3>3. Question des genres discursifs<\/h3>\n<p align=\"justify\">La question des genres discursifs est primordiale. Elle se formule \u00e0 de nombreux \u00e9gards suivant les m\u00eames cat\u00e9gories que celles auxquelles nous avons recouru <i>supra<\/i> (recours \u00e0 param\u00e8tres non-linguistiques situationnels pour les mod\u00e9liser ; probl\u00e8me de leur formulation, de leur inventaire et de leur combinaison, mise au point d\u2019une typologie, \u2026). En outre se posent des difficult\u00e9s propres \u00e0 la diachronie. Elles sont essentiellement au nombre de trois.<\/p>\n<p align=\"justify\">La premi\u00e8re, nous l\u2019avons d\u00e9j\u00e0 mentionn\u00e9, est li\u00e9e au fait que bien des genres qui informaient les pratiques discursives \u2013 en particulier \u00e0 l\u2019oral \u2013 dans des \u00e9tats anciens de la langue ne nous ont pas \u00e9t\u00e9 transmis. \u00ab Peut-\u00eatre m\u00eame ignorons-nous l\u2019existence de certains genres, disparus sans avoir laiss\u00e9 de textes t\u00e9moins \u00bb (S. Pr\u00e9vost, 2008 : \u00a7 9)<\/p>\n<p align=\"justify\">La deuxi\u00e8me difficult\u00e9 \u00e0 trait au fait qu\u2019en cinq si\u00e8cles (dans le cas de Presto), ces genres se sont profond\u00e9ment modifi\u00e9s. <i>La Princesse de Cl\u00e8ves<\/i> publi\u00e9 comme roman<i><\/i> n\u2019a gu\u00e8re \u00e0 voir &#8211; sur le plan linguistique, notamment &#8211; avec <i>Femmes<\/i> de Philippe Sollers ou un roman de C\u00e9line. Comme l\u2019\u00e9crit C. Claridge (<i>op. cit<\/i>. : 248) : <i>\u00ab<\/i> <span lang=\"en-GB\"><i>Some registers or genres are present throughout history, but with different functions and thus with partly different linguistic realisations (e.g. history writing) &#8211; in other words, while the genre remains constant, the linguistics text type undergoes change.<\/i><\/span> \u00bb Un tel changement peut aussi se faire sentir plus particuli\u00e8rement quant au topic \/ th\u00e8me d\u2019un (sous-)genre donn\u00e9<sup><a class=\"sdfootnoteanc\" href=\"#sdfootnote7sym\" name=\"sdfootnote7anc\">7<\/a><\/sup>. On observe ainsi que dans le genre des \u00ab trait\u00e9s \u00bb (qu\u2019il conviendrait certainement de raffiner) propos\u00e9 par Frantext, la th\u00e9matique religieuse est massivement repr\u00e9sent\u00e9e au XVI<sup>e<\/sup> s. alors qu\u2019elle est r\u00e9duite \u00e0 la portion congrue au XX<sup>e<\/sup> s. Et que dire de l\u2019astrologie ou de l\u2019agriculture<sup><a class=\"sdfootnoteanc\" href=\"#sdfootnote8sym\" name=\"sdfootnote8anc\">8<\/a><\/sup> ?<\/p>\n<p align=\"justify\">La troisi\u00e8me difficult\u00e9 est relative \u00e0 la disparition ou \u00e0 l\u2019apparition de genres ou de sous-genres sur la longue dur\u00e9e. Par exemple, les Myst\u00e8res religieux de la premi\u00e8re moiti\u00e9 du XVI<sup>e<\/sup> s. ont disparu du paysage du th\u00e9\u00e2tre d\u00e8s le XVII<sup>e<\/sup> s. si l\u2019on en croit C. Mazouer (2010). Inversement, on ne sait presque rien du genre de la \u00ab conversation \u00bb avant les m\u00e9thodes modernes de recueil des donn\u00e9es orales. Quant aux tweets et autres tchats<sup><a class=\"sdfootnoteanc\" href=\"#sdfootnote9sym\" name=\"sdfootnote9anc\">9<\/a><\/sup>\u2026<\/p>\n<p align=\"justify\">Ces deux derni\u00e8res difficult\u00e9s ont une incidence \u00e9vidente sur la comparabilit\u00e9<b><\/b> entre les tranches temporelles m\u00e9nag\u00e9es \u00e0 l\u2019int\u00e9rieur du corpus historique long (voir <i>supra<\/i>). Disposer de tranches synchroniques comparables implique une similitude de (sous-)genres qui y sont repr\u00e9sent\u00e9s. Privil\u00e9gier la comparabilit\u00e9 conduit ainsi le concepteur du corpus \u00e0 se centrer sur quelques (sous-)genres pour lesquels on trouve des textes tout au long de la p\u00e9riode temporelle \u00e0 couvrir, nonobstant le probl\u00e8me point\u00e9 <i>supra<\/i> (et non r\u00e9solu) que repr\u00e9sente leur \u00e9volution parfois tr\u00e8s significative dans le temps (en termes de traits linguistiques ou non linguistiques). C\u2019est le choix qui a \u00e9t\u00e9 fait par le CNNE<sup><a class=\"sdfootnoteanc\" href=\"#sdfootnote10sym\" name=\"sdfootnote10anc\">10<\/a><\/sup> (voir C. Claridge, <i>op. cit<\/i>. : 243) et que nous avons retenu pour Presto.<\/p>\n<p align=\"justify\">Une autre option pourrait consister \u00e0 choisir pour chaque tranche la totalit\u00e9 (id\u00e9alement) des (sous-) genres accessibles. Le corpus serait alors apte \u00e0 refl\u00e9ter l\u2019apparition et\/ou la disparition de tel(s) ou tel(s) d\u2019entre eux, la mise \u00e0 disposition de m\u00e9tadonn\u00e9es relatives \u00e0 ces (sous-) genres permettant \u00e0 l\u2019utilisateur de s\u00e9lectionner ceux qu\u2019il souhaite \u00e9tudier, qu\u2019ils soient \u00ab continus<sup><a class=\"sdfootnoteanc\" href=\"#sdfootnote11sym\" name=\"sdfootnote11anc\">11<\/a><\/sup> \u00bb ou non. Un autre avantage de cette seconde option est qu\u2019elle permettrait de conduire des observations dans les diff\u00e9rents genres\/registres disponibles. Or, qui s\u2019int\u00e9resse au changement linguistique sait que tel ou tel ph\u00e9nom\u00e8ne appara\u00eet d\u2019abord le plus souvent dans un (sous-)genre donn\u00e9 puis gagne ensuite d\u2019autres pratiques discursives. Par ex., comme l\u2019\u00e9crit M. Rissanen (<i>op. cit<\/i>. : <span lang=\"en-GB\">57):<\/span> \u00ab <span lang=\"en-GB\"><i>it is easy to see that such connectives as<\/i> <span lang=\"en-GB\">except, provided (that),<\/span> <span lang=\"en-GB\"><i>and<\/i><\/span> <span lang=\"en-GB\">notwithstanding<\/span> <span lang=\"en-GB\"><i>were in common use in legal and documentary texts as early as the fifteenth century, and that this use in prestigious genres may have contribute to their establishment in the emerging standard<\/i><\/span> <\/span>\u00bb<span lang=\"en-GB\">. S. Pr\u00e9vost (2015: 26) fait des observations similaires.<\/span> L\u2019inconv\u00e9nient n\u00e9anmoins d\u2019une telle politique est qu\u2019elle met en p\u00e9ril la comparabilit\u00e9 entre un certain nombre des tranches du corpus.<\/p>\n<p align=\"justify\">Probablement la solution est-elle dans l\u2019usage que fait l\u2019utilisateur des m\u00e9tadonn\u00e9es qu\u2019il a \u00e0 disposition lors de ses requ\u00eates. Gr\u00e2ce \u00e0 elles, il doit pouvoir naviguer entre des recherches portant sur tels ou tels (sous-)genres \u00e0 l\u2019int\u00e9rieur desquels il veut traquer un ph\u00e9nom\u00e8ne linguistique \u00e9mergent, et des recherches portant sur d\u2019autres (sous-)genres pr\u00e9sents contin\u00fbment dans la p\u00e9riode temporelle couverte par le corpus.<\/p>\n<h3>4. \u00ab <i>Internal temporal structure<\/i> \u00bb des corpus diachroniques longs<\/h3>\n<p align=\"justify\">Nous reprenons ici les termes de C. Claridge (<i>op. cit<\/i>. : 243) cit\u00e9s plus haut. Deux questions se posent pour la d\u00e9finition de cette structure temporelle interne. D\u2019abord, celle de l\u2019empan temporel de chaque tranche synchronique. Ensuite, leur taille (nombre de mots et textes dans chaque strate et dans la tranche totale).<\/p>\n<p align=\"justify\">Sans pr\u00e9tendre \u00e0 l\u2019exhaustivit\u00e9, la d\u00e9finition de l\u2019empan temporel des tranches nous semble pour partie li\u00e9e \u00e0 une question d\u2019ordre pratique (de plus en plus aigu\u00eb au fur et \u00e0 mesure qu\u2019on s\u2019\u00e9loigne de la p\u00e9riode contemporaine) : combien de textes num\u00e9ris\u00e9s, relevant de (sous-)genres diff\u00e9rents, sont-ils raisonnablement accessibles (\u00e9tant connues les contraintes de temps et d\u2019argent) pour les tranches de 10\/20\/30\u2026 ans les plus anciennes du corpus \u00e0 construire ? Dans Presto nous avons fait le choix de tranches temporelles de dix ans. Ce choix n\u2019a pas \u00e9t\u00e9 compl\u00e8tement arbitraire car nous souhaitions une granularit\u00e9 fine \u2013 plus fine que celle d\u2019ARCHER<sup><a class=\"sdfootnoteanc\" href=\"#sdfootnote12sym\" name=\"sdfootnote12anc\">12<\/a><\/sup> par ex. qui a fait le choix de tranches de 50 ans, ou de 20-30 ans dans le CNNE<sup><a class=\"sdfootnoteanc\" href=\"#sdfootnote13sym\" name=\"sdfootnote13anc\">13<\/a><\/sup> &#8211; et nous consid\u00e9rions que le fait de ne pas remonter au-del\u00e0 de 1500 nous permettait de rester confiants quant aux ressources de textes disponibles <i>via<\/i> les BVH et Frantext.<\/p>\n<p align=\"justify\">Le calibrage de la taille (nombre de textes et de mots) de chaque tranche temporelle et du corpus total est aussi une affaire d\u00e9licate. Il existe par ailleurs une relation \u00e9troite entre l\u2019amplitude de la p\u00e9riode temporelle qu\u2019un corpus veut couvrir et sa taille, l\u2019accroissement de l\u2019une allant de pair avec celle de l\u2019autre. Selon nous, cette question de la taille devrait pouvoir recevoir une r\u00e9ponse \u00e9tay\u00e9e, en s\u2019appuyant par ex. sur les pr\u00e9conisation de D. Biber quant \u00e0 l\u2019\u00e9tude de la distribution de traits linguistiques s\u00e9lectionn\u00e9s en fonction de leur plus ou moins grande raret\u00e9\/banalit\u00e9 dans les textes. C. Claridge (<i>op. cit<\/i>.) propose quant \u00e0 elle de tester certains acquis concernant le changement linguistique sur des corpus de plus ou moins grande taille pour d\u00e9terminer \u00e0 partir de laquelle on retrouve toutes les \u00e9tapes du changement recherch\u00e9. Pour ce qui concerne Presto, nous avons fait les choix suivants : chaque texte dont la longueur est sup\u00e9rieure \u00e0 5000 mots a \u00e9t\u00e9 \u00e9chantillonn\u00e9 pour ne pas exc\u00e9der cette taille. Cet \u00e9chantillonnage a ob\u00e9i \u00e0 un algorithme qu\u2019on peut d\u00e9crire grosso-modo comme suit : cinq extraits de 1000 mots contigus sont choisis al\u00e9atoirement dans 5 parties du texte r\u00e9parties entre le d\u00e9but et la fin de ce dernier. Pour ce qui concerne le nombre de textes \u00e9chantillonn\u00e9s dans chaque genre et dans chaque tranche temporelle ainsi que le nombre de mots et de textes dans le corpus total, nous renvoyons au \u00a7 1.4 de cette partie.<\/p>\n<h3>5. Tranches temporelles et p\u00e9riodisation de la langue<\/h3>\n<p align=\"justify\">Le fran\u00e7ais ne peut \u00e9videmment pas \u00eatre consid\u00e9r\u00e9, sur le plan linguistique, comme homog\u00e8ne et identique \u00e0 soi entre le IX<sup>e<\/sup> s. et le XXI<sup>e<\/sup> s. Vouloir le \u00ab repr\u00e9senter \u00bb dans un corpus n\u00e9cessite donc qu\u2019on se donne des p\u00e9riodes au sein desquelles on peut le consid\u00e9rer comme (relativement) stable, chacune de ces p\u00e9riodes constituant une strate qui structure la variation (diachronique) de la population langagi\u00e8re vis\u00e9e au m\u00eame titre que les (sous-)genres. Malheureusement, on ne dispose pas actuellement d\u2019une p\u00e9riodisation consensuelle des changements linguistiques du fran\u00e7ais, et la question de sa possibilit\u00e9 voire de sa pertinence reste ouverte (voir par ex. B. Combettes &amp; C. Marchello Nizia 2010, B. Combettes 2012 ; R. de Dardel, M. Banniard &amp; B. Combettes (\u00e9ds.) (2011)). Il est int\u00e9ressant d\u2019observer \u00e0 cet \u00e9gard que, pour ce qui regarde le projet de la <i>Grande Grammaire Historique du Fran\u00e7ais<\/i>, une p\u00e9riodisation possible de la langue est envisag\u00e9e par C. Marchello-Nizia (2011 : \u00a7 4.2.) non comme un point de d\u00e9part mais comme un (plus ou moins hypoth\u00e9tique) point d\u2019arriv\u00e9e<i><\/i> : \u00ab La partie conclusive, celle qui en fait motive chacun des participants \u00e0 cette entreprise, aura pour fin de pr\u00e9senter une vue d\u2019ensemble des changements qu\u2019a connus le fran\u00e7ais en douze si\u00e8cles, <i>avec la tentative d\u2019une nouvelle p\u00e9riodisation sur crit\u00e8res linguistiques<\/i><sup><i><a class=\"sdfootnoteanc\" href=\"#sdfootnote14sym\" name=\"sdfootnote14anc\">14<\/a><\/i><\/sup><i><\/i> \u00bb.<\/p>\n<p align=\"justify\">D\u2019o\u00f9 cette question : quelle relation possible entre l\u2019empan des tranches temporelles s\u00e9lectionn\u00e9es dans le corpus historique \u00e0 couverture longue et la p\u00e9riodisation des ph\u00e9nom\u00e8nes langagiers vis\u00e9s? Selon nous, il n\u2019y en a aucune et les deux notions sont \u00e0 d\u00e9coupler. En effet, le d\u00e9coupage en tranche chronologiques successives \u2013 qui sont autant de micro-tranches synchroniques \u2013 ne constitue finalement qu\u2019une sorte de \u00ab quadrillage \u00bb \u00e0 priori de la trame du temps (comme on quadrille une feuille) destin\u00e9 \u00e0 faire appara\u00eetre, sur ce fond r\u00e9gl\u00e9, des variations quantitatives relatives \u00e0 tel ou tel ph\u00e9nom\u00e8ne linguistique. Ce sont ces variations qui pourront ensuite ouvrir \u00e0 la question d\u2019\u00e9ventuelles p\u00e9riodes discernables au sein du fran\u00e7ais, et \u00e0 cet \u00e9gard, ce serait un acquis consid\u00e9rable si Presto concourait \u00e0 l\u2019identification d\u2019une p\u00e9riodisation possible dans l\u2019\u00e9volution du syst\u00e8me des pr\u00e9positions entre 1500 et 1944.<\/p>\n<h3>6. La question des droits<\/h3>\n<p align=\"justify\">Les droits d\u2019auteur (pour les textes post\u00e9rieurs \u00e0 1944) et les droits d\u2019\u00e9dition susceptibles de peser sur les \u0153uvres du pass\u00e9 constituent souvent une contrainte significative qui r\u00e9duit l\u2019acc\u00e8s aux \u0153uvres (d\u00e9j\u00e0 num\u00e9ris\u00e9es ou pouvant \u00eatre num\u00e9ris\u00e9es) lorsqu\u2019on cherche \u00e0 construire un corpus historique du fran\u00e7ais. On rappellera pour m\u00e9moire que la BFM, par ex. a d\u00fb retirer de son site en 2014 plusieurs textes \u00e0 la demande des \u00e9diteurs concern\u00e9s. Depuis 2013 (date de mise en route de Presto), les consortiums CAHIER (http:\/\/cahier.hypotheses.org) et CORLI (https:\/\/corli.huma-num.fr) ont travaill\u00e9 cette question en vue d\u2019informer au mieux la communaut\u00e9 des chercheurs, par le biais notamment de guides juridiques (http:\/\/cahier.hypotheses.org\/guides-juridiques). En ce qui concerne le corpus Presto, nous n\u2019avons sollicit\u00e9 (d\u2019un commun accord) Frantext que pour le pr\u00eat de textes relevant du domaine public, ou dont l\u2019\u00e9diteur avait probablement fait faillite ou avait cess\u00e9 ses activit\u00e9s. Ce choix a consid\u00e9rablement r\u00e9duit le potentiel de nos ressources, sans cependant l\u2019ass\u00e9cher. Pour ce qui regarde la mise \u00e0 disposition d\u2019une partie du corpus sous licence libre, la solution adopt\u00e9e (comme souvent dans ce type de recherche : voir C. Claridge, <i>op. cit<\/i>. : 245-246, \u00ab <i>copyright<\/i> \u00bb) consistera \u00e0 ne proposer au t\u00e9l\u00e9chargement et \u00e0 la consultation en ligne que la partie \u00ab domaine public \u00bb du corpus.<\/p>\n<h3>7. Echantillons ou textes int\u00e9graux ?<\/h3>\n<p align=\"justify\">Sur ce plan, les corpus historiques se trouvent quasiment sur le m\u00eame pied que les corpus contemporains, \u00e0 ceci pr\u00e8s que pour les p\u00e9riodes les plus recul\u00e9es, nous ne disposons parfois que de fragments de textes. Le cas de <i>Tristan<\/i> \u00e9voqu\u00e9 <i>supra<\/i> en est un bon exemple. Dans Presto, nous avons choisi de \u00ab doubler \u00bb le corpus \u00e9chantillonn\u00e9 par un corpus de textes int\u00e9graux qui permet \u00e0 l\u2019utilisateur de naviguer comme il le souhaite entre les deux versions.<\/p>\n<div id=\"sdfootnote1\">\n<p class=\"sdfootnote\" align=\"justify\"><a class=\"sdfootnotesym\" href=\"#sdfootnote1anc\" name=\"sdfootnote1sym\"><sup>1<\/sup><\/a> voir par ex. http:\/\/cahier.hypotheses.org\/notions-juridiques#droit_d_auteur<\/p>\n<\/div>\n<div id=\"sdfootnote2\">\n<p class=\"sdfootnote\"><a class=\"sdfootnotesym\" href=\"#sdfootnote2anc\" name=\"sdfootnote2sym\"><sup>2<\/sup><\/a> Et la sociolinguistique historique : voir P. Blumenthal &amp; D. Vigier, 2018.<\/p>\n<\/div>\n<div id=\"sdfootnote3\">\n<p class=\"sdfootnote\" align=\"justify\"><a class=\"sdfootnotesym\" href=\"#sdfootnote3anc\" name=\"sdfootnote3sym\"><sup>3<\/sup><\/a> Le linguiste int\u00e9ress\u00e9 par le genre de la conversation aujourd\u2019hui peut toujours, comme l\u2019ont fait D. Biber, S. Joahnsson, G. Leech, S. Conrad &amp; E. Finegan (<i>op. cit.<\/i>) par ex., demander \u00e0 des locuteurs d\u2019enregistrer un nombre d\u2019heures donn\u00e9 de conversations dans lesquelles ils sont impliqu\u00e9s.<\/p>\n<\/div>\n<div id=\"sdfootnote4\">\n<p class=\"sdfootnote\" align=\"justify\"><a class=\"sdfootnotesym\" href=\"#sdfootnote4anc\" name=\"sdfootnote4sym\"><sup>4<\/sup><\/a> La proc\u00e9dure suivie est d\u00e9taill\u00e9e dans <a href=\"http:\/\/ccfm.ens-lyon.fr\/IMG\/pdf\/Manuel_Descripteurs_BFM.pdf\">http:\/\/ccfm.ens-lyon.fr\/IMG\/pdf\/Manuel_Descripteurs_BFM.pdf<\/a><\/p>\n<\/div>\n<div id=\"sdfootnote5\">\n<p class=\"sdfootnote\" align=\"justify\"><a class=\"sdfootnotesym\" href=\"#sdfootnote5anc\" name=\"sdfootnote5sym\"><sup>5<\/sup><\/a> C\u2019est aussi le choix qui a \u00e9t\u00e9 fait pour le COPC<i><\/i> (<i>The Century of Prose Corpus)<\/i> par ex., si l\u2019on en croit C. Claridge (<i>op. cit<\/i>. : 243).<\/p>\n<\/div>\n<div id=\"sdfootnote6\">\n<p class=\"sdfootnote\" align=\"justify\"><a class=\"sdfootnotesym\" href=\"#sdfootnote6anc\" name=\"sdfootnote6sym\"><sup>6<\/sup><\/a> Pour une revue de ces biais, voir Auer A., Peersman C., Pickl S., Rutten G. &amp; Vosters R. (2015 : 6-7)<\/p>\n<\/div>\n<div id=\"sdfootnote7\">\n<p class=\"sdfootnote\" align=\"justify\"><a class=\"sdfootnotesym\" href=\"#sdfootnote7anc\" name=\"sdfootnote7sym\"><sup>7<\/sup><\/a> Rappelons que D. Biber (1993a : 245) int\u00e8gre le <i>topic<\/i> dans sa table des param\u00e8tres situationnels constitutifs des registres\/genres.<\/p>\n<\/div>\n<div id=\"sdfootnote8\">\n<p class=\"sdfootnote\" align=\"justify\"><a class=\"sdfootnotesym\" href=\"#sdfootnote8anc\" name=\"sdfootnote8sym\"><sup>8<\/sup><\/a> On rejoint l\u00e0 la question des langues \/ domaines de sp\u00e9cialit\u00e9.<\/p>\n<\/div>\n<div id=\"sdfootnote9\">\n<p class=\"sdfootnote\" align=\"justify\"><a class=\"sdfootnotesym\" href=\"#sdfootnote9anc\" name=\"sdfootnote9sym\"><sup>9<\/sup><\/a> De m\u00eame, Claridge (247) : \u00ab <i>Press and natural science writing (in the modern sense) are two examples of late emerging registers, which are simply not present before the late 17th century or even later. \u00bb<\/i><\/p>\n<\/div>\n<div id=\"sdfootnote10\">\n<p class=\"sdfootnote\" align=\"justify\"><a class=\"sdfootnotesym\" href=\"#sdfootnote10anc\" name=\"sdfootnote10sym\"><sup>10<\/sup><\/a> <i>Corpus of Nineteenth-century Newspaper English,<\/i> <a href=\"http:\/\/www.helsinki.fi\/varieng\/CoRD\/corpora\/CNNE\">http:\/\/www.helsinki.fi\/varieng\/CoRD\/corpora\/CNNE<\/a><\/p>\n<\/div>\n<div id=\"sdfootnote11\">\n<p class=\"sdfootnote\" align=\"justify\"><a class=\"sdfootnotesym\" href=\"#sdfootnote11anc\" name=\"sdfootnote11sym\"><sup>11<\/sup><\/a> Par continuit\u00e9, nous entendons que tel ou tel genre\/registre est pr\u00e9sent dans toutes les tranches temporelles pr\u00e9sentes dans le corpus global. <\/p>\n<\/div>\n<div id=\"sdfootnote12\">\n<p class=\"sdfootnote\" align=\"justify\"><a class=\"sdfootnotesym\" href=\"#sdfootnote12anc\" name=\"sdfootnote12sym\"><sup>12<\/sup><\/a> <i>A Representative Corpus of Historical English Registers<\/i>, <a href=\"http:\/\/www.manchester.ac.uk\/archer\">http:\/\/www.manchester.ac.uk\/archer<\/a><\/p>\n<\/div>\n<div id=\"sdfootnote13\">\n<p class=\"sdfootnote\" align=\"justify\"><a class=\"sdfootnotesym\" href=\"#sdfootnote13anc\" name=\"sdfootnote13sym\"><sup>13<\/sup><\/a> <i>Corpus of Nineteenth-century Newspaper English, <\/i><a href=\"http:\/\/www.helsinki.fi\/varieng\/CoRD\/corpora\/CNNE\">http:\/\/www.helsinki.fi\/varieng\/CoRD\/corpora\/CNNE<\/a><\/p>\n<\/div>\n<div id=\"sdfootnote14\">\n<p class=\"sdfootnote\" align=\"justify\"><a class=\"sdfootnotesym\" href=\"#sdfootnote14anc\" name=\"sdfootnote14sym\"><sup>14<\/sup><\/a> C\u2019est nous qui soulignons.<\/p>\n<\/div>\n","protected":false},"excerpt":{"rendered":"<p>Ce document est publi\u00e9 librement sur le web \u00e0 destination de la communaut\u00e9 scientifique dans le cadre de la licence Creative Commons \u00ab Paternit\u00e9-Pas d&rsquo;Utilisation Commerciale-Partage des Conditions Initiales \u00e0 l&rsquo;Identique 2.0 France \u00bb. En accord avec cette licence, si &hellip;<\/p>\n<p class=\"read-more\"> <a class=\"more-link\" href=\"https:\/\/presto.ens-lyon.fr\/?page_id=580\"> <span class=\"screen-reader-text\">Principes de constitution<\/span> Read More &raquo;<\/a><\/p>\n","protected":false},"author":1,"featured_media":0,"parent":581,"menu_order":0,"comment_status":"closed","ping_status":"closed","template":"full-width-page.php","meta":{"footnotes":""},"class_list":["post-580","page","type-page","status-publish","hentry"],"_links":{"self":[{"href":"https:\/\/presto.ens-lyon.fr\/index.php?rest_route=\/wp\/v2\/pages\/580","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/presto.ens-lyon.fr\/index.php?rest_route=\/wp\/v2\/pages"}],"about":[{"href":"https:\/\/presto.ens-lyon.fr\/index.php?rest_route=\/wp\/v2\/types\/page"}],"author":[{"embeddable":true,"href":"https:\/\/presto.ens-lyon.fr\/index.php?rest_route=\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/presto.ens-lyon.fr\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=580"}],"version-history":[{"count":7,"href":"https:\/\/presto.ens-lyon.fr\/index.php?rest_route=\/wp\/v2\/pages\/580\/revisions"}],"predecessor-version":[{"id":609,"href":"https:\/\/presto.ens-lyon.fr\/index.php?rest_route=\/wp\/v2\/pages\/580\/revisions\/609"}],"up":[{"embeddable":true,"href":"https:\/\/presto.ens-lyon.fr\/index.php?rest_route=\/wp\/v2\/pages\/581"}],"wp:attachment":[{"href":"https:\/\/presto.ens-lyon.fr\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=580"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}