Aller au contenu

Langues du monde

Les langues indo-européennes : une grande famille

Du sanskrit au français, 3,4 milliards d’humains parlent une langue indo-européenne. Retour sur la découverte de cette parenté et la langue originelle.

En bref
3,4 milliards de locuteurs La famille indo-européenne rassemble environ 446 langues vivantes, parlées par plus de 40 % de l’humanité, de l’Islande au Bangladesh.
Une parenté découverte par étapes Sassetti (1585), Jones (1786), Bopp (1816) : il a fallu deux siècles pour comprendre que le sanskrit, le grec et le latin descendaient d’une même langue disparue.
Un foyer encore débattu Steppe pontique, Anatolie, sud du Caucase : la question de l’origine géographique du proto-indo-européen n’est pas tranchée, malgré l’apport récent de la paléogénétique.

Introduction

Près de la moitié de l’humanité parle une langue indo-européenne. Le français, l’anglais, le hindi, le russe, le persan, le grec : ces langues, en apparence très différentes, descendent toutes d’un ancêtre commun que personne n’a jamais entendu. Les linguistes l’appellent le proto-indo-européen (PIE), une langue reconstruite par comparaison systématique et notée avec un astérisque pour signaler son caractère hypothétique[1].

Comment sait-on que ces langues sont parentes ? Non pas en observant de vagues ressemblances, mais en identifiant des correspondances phonétiques régulières -- des règles qui s’appliquent de mot en mot, de langue en langue, et qui ne peuvent pas résulter du hasard. C’est cette méthode, dite méthode comparative, qui fait de la linguistique historique une science et non une collection d’anecdotes.

Cet article retrace la découverte de cette parenté, explique la méthode comparative, présente les branches de la famille et examine ce que l’on sait -- et ce que l’on ignore encore -- de la langue originelle et de ses locuteurs.

La découverte : de Sassetti à Bopp

Les premières intuitions

En 1585, le marchand florentin Filippo Sassetti, installé à Goa, remarque dans ses lettres des ressemblances troublantes entre le sanskrit et l’italien : devah et dio (dieu), sapta et sette (sept), asta et otto (huit), nava et nove (neuf)[2]. Sassetti ne tire pas de conclusion théorique de ces rapprochements. Mais l’observation est posée.

Deux siècles plus tard, le 2 février 1786, le philologue britannique Sir William Jones prononce un discours devant l’Asiatic Society de Calcutta. Il y déclare que le sanskrit, le grec et le latin présentent des ressemblances si fortes qu’elles ne peuvent s’expliquer que par une origine commune : ces langues, dit-il, « have sprung from some common source, which, perhaps, no longer exists » -- « sont issues d’une source commune qui, peut-être, n’existe plus »[3]. C’est la première formulation explicite de l’hypothèse indo-européenne.

La naissance de la grammaire comparée

Le discours de Jones reste une intuition. C’est le linguiste allemand Franz Bopp qui, en 1816, en fait une science. Son premier ouvrage compare les conjugaisons du sanskrit, du grec, du latin, du persan et du gotique[4]. En montrant que ces systèmes verbaux obéissent aux mêmes schémas, Bopp fonde la grammaire comparée, c’est-à-dire l’étude systématique des correspondances entre langues apparentées.

En 1822, Jacob Grimm décrit la première loi phonétique : les consonnes germaniques correspondent de façon régulière à celles des autres langues indo-européennes. Le p du latin pater (père) correspond au f de l’anglais father. Le t de tres (trois) correspond au th germanique. Ces correspondances ne sont pas des coïncidences : elles obéissent à un schéma systématique, connu depuis sous le nom de loi de Grimm[5].

En 1861, August Schleicher publie son Compendium et propose le modèle de l'arbre généalogique (Stammbaum) pour représenter les relations entre langues : une langue mère se divise en branches, qui se subdivisent à leur tour[6]. Ce modèle, s’il simplifie la réalité, reste le cadre de référence. Dès 1872, Johannes Schmidt propose un complément : le modèle de la vague (Wellentheorie), selon lequel les innovations linguistiques se diffusent par contact entre langues voisines, comme des ondes dans l’eau[7]. Aujourd’hui, les linguistes combinent les deux modèles : l’arbre rend compte de la divergence initiale entre les branches, la vague explique les convergences secondaires entre langues géographiquement proches.

La méthode : comment on découvre une parenté

La méthode comparative repose sur un principe simple : entre langues apparentées, les différences phonétiques ne sont pas aléatoires. Elles sont régulières. Là où le latin a un p, le gotique a un f -- non pas dans un mot ou deux, mais systématiquement. C’est cette régularité qui distingue une parenté véritable d’une ressemblance fortuite ou d’un emprunt.

Prenons les termes de parenté. Les formes reconstruites du proto-indo-européen sont notées avec un astérisque (*), car elles n’ont jamais été attestées par écrit[1].

Sens PIE reconstruit Sanskrit Grec Latin Gotique
pere \*ph2ter pitar pater pater fadar
mere \*meh2ter matar meter mater --
frere \*bhreh2ter bhratr phrater frater brothar
soeur \*swesor svasar eor soror swistar
fille \*dhugh2ter duhitr thugater -- dauhtar

Les correspondances sautent aux yeux. Le p du latin et du grec se retrouve comme f en gotique (loi de Grimm). Le bh du sanskrit correspond au ph grec, au f latin, au b gotique. Ces régularités traversent tout le vocabulaire, des termes de parenté aux nombres.

Nombre PIE Gotique Latin Grec
deux \*dwoh1 twai duo duo
trois \*treyes threis tres treis
cinq \*penkwe fimf quinque pente
sept \*septm sibun septem hepta
dix \*dekmt taihun decem deka

Source des reconstructions : vocabulaire indo-européen reconstruit d’après les données comparatives compilées dans les tableaux de référence[9].

C’est cette accumulation de correspondances régulières qui rend l’hypothèse du hasard intenable. Comme le résume l'Encyclopédie Universalis : « le hasard comme facteur explicatif devient négligeable lorsque croît le nombre de concordances »[4].

Le basque, à l’inverse, est classé comme isolat précisément parce qu’aucune correspondance phonétique régulière n’a pu être établie entre lui et une autre langue connue, malgré des siècles de tentatives.

Les branches de la famille

Proto-indo-européen (reconstruit, non attesté) Anatolien hittite, louvite XXe s. av. J.-C. Tokharien Asie centrale VIe-VIIe s. Indo-iranien hindi, persan, kurde... ~1,5 milliard Germanique anglais, allemand... ~450 millions Roman français, espagnol... ~430 millions Balto-slave russe, polonais, lituanien... ~320 millions Autres grec, celtique, arménien, albanais latin (branche italique) français espagnol indo-aryen (hindi, bengali...) iranien (persan, kurde...) branche éteinte branche vivante Nombre de locuteurs : estimations, Université Laval
Arbre simplifié des branches indo-européennes

La famille indo-européenne compte environ 446 langues vivantes selon l'Ethnologue, et 586 langues (vivantes et éteintes) selon la base de données Glottolog[10]. Ses locuteurs représentent environ 3,4 milliards de personnes, soit quelque 42 % de la population mondiale[11].

Les principales branches vivantes sont les suivantes :

  • Indo-iranienne : la plus vaste, avec environ 1,5 milliard de locuteurs et quelque 400 langues. Elle comprend le hindi, l’ourdou, le bengali, le persan, le kurde, le pachto, entre autres[12].
  • Germanique : environ 450 millions de locuteurs. L’anglais, l’allemand, le néerlandais, le suédois, le norvégien, le danois, l’islandais[12].
  • Romane (ou italique) : environ 430 millions de locuteurs. Le français, l’espagnol, le portugais, l’italien, le roumain. Toutes descendent du latin -- un processus décrit en détail dans Du latin au français[12].
  • Balto-slave : environ 320 millions de locuteurs au total, dont environ 315 millions pour le groupe slave (russe, polonais, tchèque, serbe, ukrainien, bulgare) et 5,5 millions pour le groupe balte (lituanien, letton)[12].
  • Hellénique : le grec moderne et ses dialectes, environ 13 millions de locuteurs[10].
  • Celtique : moins de 2 millions de locuteurs. L’irlandais, le gallois, le breton, l’écossais. Une branche en recul démographique depuis des siècles[12].
  • Arménienne : environ 6 millions de locuteurs[10].
  • Albanaise : environ 7,5 millions de locuteurs[10].

Deux branches majeures sont éteintes. La branche anatolienne (hittite, louvite, lydien, lycien) est la plus anciennement attestée par écrit : les tablettes hittites de Kultepe remontent au XXe siècle avant notre ère[11]. La branche tokharienne, parlée en Asie centrale, est attestée par des manuscrits des VIe-VIIe siècles de notre ère[13].

Le nombre exact de branches est lui-même discuté : certaines classifications en comptent 8 (Glottolog regroupe balte et slave en une seule branche), d’autres 12 (Larousse distingue davantage de groupes)[10] [13].

Le proto-indo-européen : une langue reconstruite

Une langue que personne n’a entendue

Le proto-indo-européen n’a laissé aucun texte. Il est entièrement reconstruit par la méthode comparative, à partir des correspondances régulières entre les langues qui en descendent. L'Encyclopédie Universalis le définit comme une « langue non attestée directement par des témoignages écrits »[4].

Sa datation est débattue. L’estimation classique le situe entre 4500 et 2500 avant notre ère[14]. Cette fourchette s’appuie notamment sur le vocabulaire reconstruit : les formes proto-indo-européennes désignant le cheval domestique et le véhicule à roues suggèrent une société qui connaissait ces innovations. Or, selon Anthony et Ringe (2015), ces technologies n’existaient pas avant 4000 avant notre ère, ce qui exclut une datation plus haute[15].

Une confirmation inattendue est venue du hittite. En 1879, Ferdinand de Saussure, alors âgé de vingt et un ans, postule l’existence de phonèmes disparus dans le proto-indo-européen, qu’il appelle des coefficients sonantiques. En 1927, Jerzy Kurylowicz montre que le hittite conserve un son, noté h, exactement là où Saussure avait prédit l’un de ces phonèmes. C’est la théorie des laryngales, l’une des plus belles confirmations de la méthode comparative[14].

Ce que le vocabulaire révèle

Le vocabulaire reconstruit du proto-indo-européen esquisse une société. On y trouve des mots pour le cheval, la roue, le joug, la laine, le miel, la neige. On y trouve un système de parenté patrilinéaire, avec des termes distincts pour le père, la mère, le frère, la soeur, la fille. Ces indices orientent les recherches sur la localisation géographique et la culture des locuteurs du PIE, même s’il faut les manier avec prudence : un vocabulaire reconstruit reste une hypothèse, pas un document.

D’où venaient-ils ? Le débat sur le foyer originel

La question du foyer originel (Urheimat) du proto-indo-européen divise les spécialistes depuis plus d’un siècle. Trois grandes hypothèses s’affrontent aujourd’hui.

L’hypothèse des steppes (kourgane)

Formulée par l’archéologue lituano-américaine Marija Gimbutas en 1956, cette hypothèse situe le foyer du PIE dans la steppe pontique, au nord de la mer Noire, en lien avec la culture Yamna (vers 3300-2600 avant notre ère)[16]. L’archéologue David Anthony (The Horse, the Wheel, and Language, 2007) a défendu et développé cette hypothèse en s’appuyant sur les données archéologiques.

Depuis 2015, la paléogénétique a apporté des arguments de poids. Deux études publiées dans Nature -- Haak et al. (2015) et Allentoft et al. (2015) -- ont montré une migration massive de populations de la steppe vers l’Europe au IIIe millénaire avant notre ère[16]. Ces résultats ont renforcé l’hypothèse kourgane, aujourd’hui considérée comme majoritaire parmi les spécialistes.

L’hypothèse anatolienne

Proposée par l’archéologue Colin Renfrew (Archaeology and Language, 1987), cette hypothèse place le foyer en Anatolie (actuelle Turquie) vers 7000 avant notre ère. La diffusion des langues indo-européennes aurait accompagné l’expansion de l’agriculture vers l’Europe au Néolithique[15].

Des études de phylogénétique bayésienne (Gray et Atkinson, 2003 ; Bouckaert et al., 2012) ont produit des datations compatibles avec cette hypothèse. Cependant, Anthony et Ringe (2015) objectent que le vocabulaire reconstruit du PIE (cheval, roue) est incompatible avec une datation aussi haute. Le linguiste Alwin Kloekhorst a déclaré en 2023 que « personne ne peut plus sérieusement défendre l’hypothèse anatolienne pour le proto-indo-européen classique » -- c’est-à-dire pour l’ancêtre commun des branches non anatoliennes, sans exclure que l’Anatolie ait joué un rôle dans la divergence plus ancienne de la branche anatolienne elle-même[15].

Le modèle hybride

En juillet 2023, Heggarty et al. ont publié dans Science (vol. 381) une étude portant sur 170 concepts lexicaux comparés dans 161 langues indo-européennes. Leurs résultats datent la divergence initiale de la famille à environ 8 100 ans avant le présent, avec un foyer primaire situé au sud du Caucase. La steppe pontique aurait ensuite servi de relais pour la diffusion vers l’Europe[17]. Ce modèle tente de réconcilier les arguments des deux camps.

Parallèlement, les travaux de David Reich et Iosif Lazaridis (Harvard, 2022) suggèrent que les populations de la culture Yamna résultaient elles-mêmes d’un mélange entre chasseurs-cueilleurs du Caucase et d’Europe de l’Est, ce qui déplacerait le foyer primaire vers les plateaux caucasiens[18]. Le linguiste Guus Kroonen a toutefois objecté que le PIE manque de vocabulaire agricole, ce qui serait surprenant pour une langue née dans une région où l’agriculture dominait[18].

Le débat reste ouvert. La convergence entre données linguistiques, archéologiques et génétiques est prometteuse, mais les trois disciplines ne s’accordent pas encore sur un scénario unique.

The Sanscrit language [...] bears a stronger affinity, both in the roots of verbs and in the forms of grammar, to the Greek and the Latin than could possibly have been produced by accident [...]. No philologer could examine them all three, without believing them to have sprung from some common source, which, perhaps, no longer exists.

William Jones, 2 février 1786

Conclusion

La famille indo-européenne est la mieux étudiée de toutes les familles de langues. Deux siècles de recherches ont permis de reconstruire une proto-langue, d’identifier les lois qui régissent le changement phonétique, de cartographier les branches et sous-branches d’un arbre immense. Et pourtant, des questions fondamentales restent sans réponse définitive : où vivaient les locuteurs du proto-indo-européen ? Comment leurs langues se sont-elles répandues sur un demi-continent ?

Le français, le breton, le russe et le hindi sont des cousins. Le basque, lui, reste à l’écart : seul isolat pré-indo-européen vivant en Europe occidentale, il rappelle qu’avant l’expansion de cette grande famille, d’autres langues occupaient le continent. Certaines ont survécu. La plupart ont disparu sans laisser de traces.

Bibliographie

  • Bopp, Franz. Über das Conjugationssystem der Sanskritsprache in Vergleichung mit jenem der griechischen, lateinischen, persischen und germanischen Sprache. Francfort, 1816.
  • Gimbutas, Marija. « The Prehistory of Eastern Europe, Part I. » American School of Prehistoric Research Bulletin, 20, 1956.
  • Heggarty, Paul, et al. « Language trees with sampled ancestors support a hybrid model for the origin of Indo-European languages. » Science, 381, 28 juillet 2023.
  • Meillet, Antoine. Introduction à l’étude comparative des langues indo-européennes. Paris, 1903.
  • Renfrew, Colin. Archaeology and Language: The Puzzle of Indo-European Origins. Londres : Jonathan Cape, 1987.
  • Schleicher, August. Compendium der vergleichenden Grammatik der indogermanischen Sprachen. Weimar, 1861.
  • CNRTL / TLFi, articles « indo-européen » et « sanskrit » (cnrtl.fr), consultés le 2026-09-30.
  • Dictionnaire de l’Académie française, 9e éd., article « indo-européen » (dictionnaire-academie.fr).
  • Encyclopédie Universalis, article « Indo-européen : les langues de départ » (universalis.fr).
  • Glottolog 5.3, entrée « Indo-European » (glottolog.org).
  • Université Laval, « Famille indo-européenne » (axl.cefan.ulaval.ca).

Notes et références

  1. Les formes reconstruites sont notées avec un astérisque (*) pour signaler leur caractère hypothétique. Aucun texte en proto-indo-européen n’a jamais été retrouvé. ↑
  2. Sassetti, lettres depuis Goa, 1585. Rapprochements rapportés par l’article « Indo-European languages » de Wikipedia EN ; aucune source éditoriale indépendante n’a été consultée directement pour ce fait dans le dossier. ↑
  3. William Jones, « Third Anniversary Discourse », Asiatic Society de Calcutta, 2 février 1786. Citation d’après l’article biographique de Wikipedia EN, lui-même fondé sur les actes de la société. ↑
  4. Encyclopédie Universalis, article « Indo-européen : les langues de départ ». ↑
  5. La loi de Grimm décrit les correspondances régulières entre consonnes germaniques et consonnes des autres langues indo-européennes : p > f, t > th, k > h, etc. ↑
  6. Schleicher, Compendium der vergleichenden Grammatik der indogermanischen Sprachen, 1861. ↑
  7. Schmidt, Die Verwandtschaftsverhältnisse der indogermanischen Sprachen, 1872. ↑
  8. CNRTL / TLFi, article « indo-européen ». ↑
  9. Données comparatives d’après les tableaux du vocabulaire indo-européen reconstruit (source 10 du dossier). ↑
  10. Glottolog 5.3, entrée « Indo-European » (indo1319). ↑
  11. Chiffre de 446 langues vivantes d’après Ethnologue, cité par l’article « Indo-European languages » de Wikipedia EN. Le total de 3,4 milliards de locuteurs est cohérent avec les chiffres par branche de l’Université Laval (~3 milliards cumulés) mais n’est confirmé, dans le dossier, que par Wikipedia EN. Les premières attestations hittites de Kultepe sont également rapportées par cette source. ↑
  12. Université Laval, « Famille indo-européenne ». ↑
  13. Encyclopédie Larousse, article « Indo-européen ». ↑
  14. Datation classique du PIE (4500-2500 av. J.-C.) d’après l’article « Indo-européen commun » de Wikipedia FR, cohérente avec la fourchette indiquée par l’Encyclopédie Larousse (source 6 du dossier). Théorie des laryngales : ibid., confirmée par Britannica et Wikipedia EN « Laryngeal theory ». ↑
  15. Arguments d’Anthony et Ringe (2015) et de Kloekhorst (2023) d’après l’article « Anatolian hypothesis » de Wikipedia EN (source 13 du dossier). L’Encyclopédie Larousse (source 6) mentionne également l’hypothèse anatolienne de Renfrew. ↑
  16. Gimbutas (1956), Haak et al. (2015), Allentoft et al. (2015) d’après l’article « Kurgan hypothesis » de Wikipedia EN (source 14 du dossier). L’Encyclopédie Larousse (source 6) décrit également l’hypothèse kourgane et les trois vagues d’expansion depuis les steppes. ↑
  17. Heggarty, Paul, et al. « Language trees with sampled ancestors support a hybrid model for the origin of Indo-European languages », Science, 381, 2023. Résumé d’après un site de vulgarisation (simon.net.nz) ; l’article original n’a pas été consulté directement (accès restreint). Les chiffres (161 langues, 8 100 ans BP, foyer au sud du Caucase) sont confirmés par ScienceDaily. ↑
  18. D’après un résumé publié par le site de vulgarisation Hérodote.net (source 12 du dossier). L’étude originale de Reich et Lazaridis (2022) n’a pas été consultée directement. ↑
indo-européen proto-langue méthode-comparative linguistique-historique famille-de-langues