Résumé

  • En 1972, Karen Spärck Jones a défini la spécificité d’un terme par son usage dans une collection, et non par le seul degré de précision de son sens.
  • Ses essais montrent qu’il faut diminuer le poids des termes fréquents plutôt que les supprimer, car ils restent nécessaires au rappel.
  • Un IDF élevé atteste une rareté relative sous un corpus et des règles identifiés ; il n’atteste ni pertinence, ni autorité, ni exactitude factuelle.

Le mot « index » sépare peu de documents dans un fonds consacré aux sciences de l’information. Dans un corpus aéronautique, il peut au contraire être rare. Ce n’est pas le dictionnaire qui a changé, mais la population à l’intérieur de laquelle on mesure le mot. L’article de 1972 de Spärck Jones, « A statistical interpretation of term specificity and its application in retrieval », part de cette distinction.

La spécificité était volontiers conçue comme une propriété sémantique : « cacao » paraît plus précis que « boisson ». Or un descripteur très précis peut devenir peu discriminant s’il est attribué à presque tous les documents d’un domaine. Spärck Jones propose donc une seconde définition, statistique : la spécificité dépend du nombre de documents auxquels le terme s’applique.

Ce déplacement rend le poids révisable. La croissance du fonds, sa composition thématique, le niveau de détail de l’indexation, la racinisation et même la définition d’un document modifient la distribution. L’IDF n’est pas une propriété conservée par le mot ; c’est un résultat produit par une collection.

Ne pas confondre fréquent et inutile

Les termes très fréquents créaient du bruit, mais leur retrait brutal abaissait fortement le plafond de rappel. Les requêtes utilisaient justement beaucoup de mots familiers. Les effacer revenait à fermer des chemins vers des documents pertinents.

La solution consistait à conserver leur contribution tout en donnant davantage de valeur aux correspondances plus rares. La formule initiale utilisait des paliers entiers liés aux puissances de deux. Stephen Robertson l’a ensuite décrite comme une approximation de la forme aujourd’hui familière log(N/n), où N désigne le nombre de documents et n le nombre de documents contenant le terme.

Cette fréquence documentaire n’est pas la fréquence du terme à l’intérieur d’un document. Gerard Salton et le projet SMART avaient fait progresser l’indexation automatique, la pondération par fréquence interne et l’évaluation des systèmes. Spärck Jones cite ces travaux, mais mesure une autre propriété : la diffusion d’un terme dans l’ensemble comparé. TF et IDF pourront être combinés ; leurs preuves ne deviennent pas pour autant identiques.

Une amélioration établie dans trois laboratoires documentaires

L’étude porte sur trois collections : 200 documents pour Aslib Cranfield, 541 pour INSPEC et 797 pour la collection du College of Librarianship Wales. Malgré des vocabulaires et des requêtes différents, la pondération améliore nettement la recherche par rapport à la simple coordination non pondérée, avec des écarts jugés statistiquement significatifs.

La prudence fait partie du résultat. Ces ensembles ne sont pas de taille Web, et l’article réclame des essais beaucoup plus vastes. En 1973, « Index term weighting » compare plusieurs logiques de pondération et confirme des gains matériels dans des environnements distincts. Il ne transforme pas la fréquence en essence sémantique.

Cyril Cleverdon et l’équipe de Cranfield avaient construit les documents tests, les questions, les jugements de pertinence et la discipline de comparaison par précision et rappel. Spärck Jones s’est appuyée sur cette infrastructure. Son discours SIGIR de 1988 rappelle que des arguments plausibles sur la classification ne suffisaient pas : il fallait mesurer leur effet en recherche.

Le Cambridge Language Research Unit de Margaret Masterman constitue une autre racine, avec ses travaux sur les thésaurus, les cooccurrences et la classification automatique ; Roger Needham contribuait à cette culture de recherche. Martin Kay a cosigné avec Spärck Jones des travaux généraux sur le traitement automatique des langues et Linguistics and Information Science, mais les sources ne lui attribuent pas la proposition IDF de 1972. Stephen Robertson a ensuite développé avec elle la pondération de pertinence et le modèle probabiliste. Cranfield, SMART, CLRU, l’IDF et la lignée menant à BM25 sont liés sans être une seule invention.

Quatre certificats que l’IDF ne délivre pas

Un terme rare n’est pas nécessairement important : une faute, un identifiant aléatoire ou une phrase mensongère isolée peuvent être rares. Il n’est pas nécessairement pertinent : la pertinence relie une requête, un document et un besoin. Il n’est pas nécessairement autorisé : l’autorité dépend de la provenance. Il n’est pas nécessairement vrai : la fréquence ne vérifie aucun fait.

Le poids n’est pas non plus transportable sans nouveau calcul. Fenêtre temporelle, langue, dédoublonnage, segmentation et frontières documentaires font varier N et n. L’énoncé défendable reste modeste : dans la collection C, à l’instant T et selon la règle R, ce terme est relativement rare.

Cette modestie explique la longévité de l’IDF. Il répond efficacement à une question de discrimination interne. Lui demander de juger la vérité reviendrait à effacer la limite qui le rend testable.

Sources principales