Profondeur d'historique des registres de brevets, dessins et modèles : ce que mesure le jeu de données
Combien d'années d'antériorité un registre de propriété industrielle rend-il réellement interrogeable ? Relevé des écarts entre profondeur affichée, numérisée et exploitable.
À retenir
- La profondeur annoncée d'un registre de brevets et la profondeur réellement interrogeable en requête automatisée sont deux grandeurs distinctes, souvent séparées par plusieurs décennies.
- Les dessins et modèles présentent l'historique exploitable le plus court de l'échantillon, parce que leur contenu est graphique et résiste à l'indexation en texte intégral.
- Une recherche d'antériorité qui ne documente pas la fenêtre temporelle réellement couverte produit un résultat négatif ininterprétable.
- Le relevé se reproduit avec un jeu de requêtes fixes, une fenêtre d'exécution courte et une trace horodatée de chaque réponse obtenue.
Toute recherche d'antériorité repose sur une hypothèse rarement vérifiée : le registre interrogé contiendrait l'ensemble des titres publiés depuis sa création. Dans les faits, la profondeur d'historique varie d'un office à l'autre, d'une famille de titre à l'autre, et surtout entre ce qui est numérisé, ce qui est indexé en texte intégral et ce qui reste consultable uniquement sous forme d'image. Ces trois états ne se recouvrent pas.
Ce jeu de données décrit un relevé de profondeur mené sur un échantillon de registres de propriété industrielle accessibles publiquement : brevets, dessins et modèles, marques. L'objectif n'est pas de classer les offices, mais de documenter l'écart entre la date de création annoncée d'un registre et la date à partir de laquelle une requête automatisée renvoie des résultats stables, complets et rejouables à l'identique.
Les valeurs présentées ci-dessous sont des ordres de grandeur d'observation, arrondis, issus de requêtes répétées sur une même semaine. Elles décrivent l'état d'un accès public à un instant donné, pas une caractéristique intrinsèque des institutions concernées. Le protocole, les définitions retenues et les limites sont détaillés pour qu'une autre équipe de veille puisse refaire le relevé et comparer ses résultats aux nôtres.
Ce que mesure le jeu de données et sur quel échantillon il porte
L'échantillon retient une quinzaine de points d'accès publics correspondant à des offices nationaux, régionaux et à des bases agrégées, choisis pour leur usage courant en veille technologique plutôt que pour leur représentativité statistique. Chaque point d'accès est traité comme une unité d'observation distincte : un même office exposant à la fois une interface de consultation et un service de données ouvertes compte pour deux entrées, car les deux ne couvrent pas la même période.
Pour chaque entrée, le relevé consigne quatre grandeurs : l'année de création déclarée du registre, l'année du document le plus ancien effectivement restitué par une requête large, l'année à partir de laquelle une recherche en texte intégral renvoie des occurrences, et l'année à partir de laquelle les métadonnées structurées, classification et titulaire notamment, sont renseignées de façon systématique plutôt que sporadique.
Le protocole tient en trois requêtes standardisées, identiques pour tous les points d'accès : une requête sans filtre triée par date croissante, une requête sur un terme technique très répandu, et une requête sur un code de classification stable dans le temps. Chaque réponse est horodatée, le nombre de résultats est consigné, et l'ensemble est rejoué à quarante-huit heures d'intervalle pour écarter les réponses transitoires.
Trois définitions à ne pas confondre : profondeur nominale, numérisée et interrogeable
La profondeur nominale est celle que le registre revendique dans sa documentation : la date de fondation de l'office ou du système de dépôt. C'est la valeur la plus visible et la moins opérante, parce qu'elle décrit une continuité administrative et non une continuité documentaire. Un registre créé au dix-neuvième siècle expose rarement en ligne les titres de ses premières décennies.
La profondeur numérisée correspond aux documents dont une image existe et se consulte. Elle remonte souvent loin, parfois jusqu'aux origines, mais elle ne se prête à aucune recherche automatisée : sans couche de reconnaissance de caractères, le contenu reste opaque à toute requête textuelle. Un fonds numérisé mais non indexé est visible pour un humain qui sait quoi chercher et invisible pour une chaîne de veille.
La profondeur interrogeable est la seule grandeur qui compte pour un dispositif automatisé : l'année à partir de laquelle une requête renvoie de façon fiable les titres pertinents. C'est elle que le jeu de données cherche à isoler, en distinguant encore la recherche plein texte, plus tardive, de la recherche sur métadonnées structurées, généralement disponible sur une période plus longue mais moins fine.
Ordres de grandeur relevés par famille de titre de propriété industrielle
Le tableau ci-dessous résume les écarts observés, exprimés en décennies plutôt qu'en années précises, conformément à la nature approximative du relevé. Les valeurs sont des médianes d'observation sur l'échantillon, non des moyennes : quelques points d'accès très anciens ou très récents déformeraient une moyenne sans rien apprendre sur le cas courant. Les bornes hautes et basses ne sont pas reportées ici pour éviter une fausse précision.
| Famille de titre | Profondeur nominale | Profondeur numérisée | Recherche plein texte | Métadonnées systématiques |
|---|---|---|---|---|
| Brevets | plus d'un siècle | environ un siècle | trois à quatre décennies | trois décennies |
| Marques | plus d'un siècle | cinq à six décennies | trois décennies | deux à trois décennies |
| Dessins et modèles | plus d'un siècle | trois à quatre décennies | une à deux décennies | deux décennies |
| Bases agrégées multi-offices | sans objet | variable | deux à trois décennies | deux décennies |
Le contraste le plus net porte sur les dessins et modèles. Leur contenu informatif est graphique : une représentation, une vue, une planche. Le texte associé se réduit souvent à un intitulé et à un code de classification, ce qui rend la recherche plein texte peu discriminante et retarde d'autant la date à partir de laquelle une veille automatisée devient utile. Les brevets, à l'inverse, sont textuels par construction.
Le deuxième enseignement tient à la convergence des colonnes de droite. Quelle que soit la famille de titre, la fenêtre réellement exploitable par une chaîne automatisée se situe dans un ordre de grandeur de deux à quatre décennies. Au-delà, la recherche redevient un travail manuel, documentaire, mené sur des images et des index papier numérisés, avec un coût par titre sans rapport avec celui d'une requête.
Pourquoi l'historique affiché dépasse presque toujours l'historique exploitable
L'écart n'est pas un défaut de transparence, il traduit une succession de chantiers techniques indépendants. La numérisation d'un fonds, la reconnaissance de caractères sur des documents anciens, la normalisation des noms de titulaires et l'attribution rétrospective de codes de classification modernes sont quatre opérations distinctes, menées à des rythmes différents et rarement achevées sur la même période de couverture.
S'y ajoutent des ruptures de nomenclature. Les systèmes de classification ont été révisés plusieurs fois, et les reprises rétroactives sont partielles. Une requête portant sur un code contemporain rate mécaniquement les titres anciens jamais reclassés, sans qu'aucun message d'erreur ne le signale. Le résultat est un silence documentaire : la requête aboutit, elle renvoie zéro, et rien n'indique que la zone interrogée n'était pas couverte.
Enfin, la qualité de la reconnaissance de caractères sur des documents typographiés’il y a plusieurs décennies reste inégale. Un même terme technique se retrouve orthographié de plusieurs manières dans l'index, ce qui abaisse le rappel sans que le taux d'erreur soit publié. Le relevé traite cette zone grise comme non interrogeable, choix conservateur qui raccourcit la profondeur mesurée mais évite de surestimer la couverture.
Un résultat négatif n'a de valeur que si la fenêtre temporelle réellement couverte par la requête est connue et documentée. Sans cela, l'absence de résultat ne prouve rien.
Ce que la profondeur réelle change à une veille brevets et à une recherche d'antériorité
La conséquence la plus directe concerne l'interprétation des recherches infructueuses. Conclure qu'une antériorité n'existe pas suppose d'avoir couvert la période où elle aurait pu apparaître. Si la profondeur interrogeable s'arrête trois décennies en arrière et que la technologie examinée a des racines plus anciennes, la conclusion négative ne porte que sur une fraction du champ, et doit être énoncée comme telle dans le rapport.
La deuxième conséquence porte sur la construction du corpus. Une veille sérieuse ne se contente pas d'un point d'accès unique : elle combine plusieurs registres dont les fenêtres de couverture se recouvrent partiellement, de façon que la zone aveugle de l'un soit compensée par la zone couverte de l'autre. Documenter ces fenêtres est un prérequis à la constitution du corpus, pas une annexe méthodologique.
La troisième conséquence est organisationnelle. Le délai de détection d'un dépôt récent dépend de la fréquence de publication du registre, pas de sa profondeur historique, et ces deux dimensions se confondent souvent dans les cahiers des charges. Une plateforme comme NewsCore (www.newscore.fr) couvre en continu des millions de sources, détecte les publications dès leur mise en ligne et relie chaque signal à sa source primaire, ce qui traite la question de la fraîcheur ; la question de la profondeur relève du choix des registres eux-mêmes et reste à la charge de l'équipe qui définit le périmètre.
Limites du relevé et conditions de reproductibilité
Première limite : le relevé mesure un accès public, à une date donnée, avec des requêtes anonymes. Les accès sous licence, les extractions négociées et les jeux de données livrés hors interface offrent souvent une couverture supérieure. Les valeurs publiées ici décrivent donc la situation d'une équipe qui travaille avec les moyens ouverts, ce qui correspond au cas fréquent mais pas au cas maximal.
Deuxième limite : la notion de résultat stable comporte une part de jugement. Nous considérons qu'une année est interrogeable lorsque les trois requêtes standardisées renvoient des volumes cohérents entre deux exécutions espacées de quarante-huit heures. Un autre seuil, plus strict ou plus permissif, décalerait les bornes de quelques années. Ce paramètre est explicité pour que la comparaison entre relevés reste possible.
Troisième limite : l'échantillon privilégie les registres de langue européenne, ce qui sous-représente des zones où la profondeur numérisée suit une autre trajectoire. La reproduction du relevé demande trois éléments seulement : la liste des points d'accès, le jeu des trois requêtes, et un journal horodaté des réponses. Ces éléments constituent la chaîne de garde minimale sans laquelle un chiffre de couverture n'est pas vérifiable.
Questions fréquentes
Sur combien d'années remonte une recherche de brevets en ligne ?
Selon les observations de ce relevé, une recherche plein texte fiable couvre un ordre de grandeur de trois à quatre décennies sur les brevets, alors que les images numérisées remontent souvent à un siècle. La différence tient à l'indexation : consulter n'est pas interroger. Pour les périodes antérieures, la recherche redevient un travail manuel sur index et fonds numérisés, dont le coût par titre est sans commune mesure.
Pourquoi une recherche d'antériorité ne renvoie-t-elle aucun résultat alors que le titre existe ?
Trois causes reviennent : le document se situe hors de la fenêtre interrogeable du registre, il n'a jamais été reclassé dans la nomenclature contemporaine utilisée par la requête, ou la reconnaissance de caractères a dégradé les termes recherchés. Aucune de ces situations ne produit de message d'erreur. C'est pourquoi une conclusion négative doit toujours mentionner la période et les registres réellement couverts.
La veille des dessins et modèles est-elle plus difficile que celle des brevets ?
Elle l'est sur le plan de la recherche rétrospective, parce que l'information utile est graphique et se prête mal à l'indexation textuelle. Le relevé situe la profondeur exploitable de cette famille de titres nettement en deçà de celle des brevets. En revanche, pour le suivi des dépôts récents, les dessins et modèles constituent un signal avancé précieux, souvent antérieur à toute communication commerciale.
Comment documenter le périmètre temporel d'une veille brevets dans un rapport ?
En consignant, pour chaque registre interrogé, l'année de départ retenue, le type de recherche employé, plein texte ou métadonnées, et la date d'exécution des requêtes. Ces trois informations suffisent à rendre le résultat interprétable et rejouable. Elles transforment une affirmation invérifiable, aucune antériorité trouvée, en un constat borné : aucune antériorité trouvée dans tel périmètre, sur telle période, à telle date.