GitHub a annoncé le 5 octobre 2026 ReviewBench, un outil d’évaluation public consacré aux assistants d’intelligence artificielle qui relisent le code. Disponible en version de recherche, il vise à comparer leurs capacités à repérer des problèmes dans les modifications proposées par les développeurs. [1]
Un test sur des modifications réelles
Selon GitHub, ReviewBench rassemble 219 demandes de fusion, ou « pull requests », issues de 187 dépôts publics et couvrant 19 langages. Cet échantillon a été construit après l’analyse des caractéristiques de 103,9 millions de demandes de fusion. Ce dernier chiffre décrit le travail de sélection, pas le nombre de cas du test. [1]
Un classement à lire avec prudence
Au 6 octobre, le site présente sept agents et distingue plusieurs mesures. La précision exprime la part des signalements jugés corrects ; le rappel mesure la part des problèmes de référence retrouvés. Un outil peut donc produire peu de fausses alertes tout en laissant passer des défauts. [2]
L’équipe ReviewBench précise avoir elle-même exécuté les premiers tests : les fournisseurs concernés n’ont ni réalisé ni vérifié ces résultats initiaux. Les versions testées datent de périodes différentes et ont pu évoluer depuis. Ces scores décrivent ce corpus, sans garantir les mêmes performances sur votre propre code. [2]
Ce que cela change pour une équipe web
Notre conseil : utiliser ce benchmark pour préparer une comparaison, puis tester les outils sur quelques modifications représentatives de son projet. La question utile reste : quels problèmes pertinents l’assistant détecte-t-il, et combien de commentaires faut-il écarter ?
À titre de contexte, la documentation de Copilot permet déjà de demander une revue depuis une pull request et de consulter ses suggestions. Par défaut, il dépose des commentaires, pas une approbation comptant pour la fusion ; les approbations nécessitent une configuration distincte. [3]
ReviewBench est ainsi un point de départ pour évaluer un assistant, pas une raison de supprimer les tests du projet ou la validation humaine.
Sources
[1] GitHub — Annonce de ReviewBench. Michelle Zhou et Alejandro Carderera de Diego, 5 octobre 2026.
[2] ReviewBench — Classement et avertissements. Note de lancement datée du 5 octobre 2026.
[3] GitHub Docs — Utiliser la revue de code Copilot. Documentation de contexte, date de publication non précisée.
Sources consultées le 6 octobre 2026.
Crédit photographique
Photo d’illustration d’archive, sans lien avec le lancement de ReviewBench : Tirza van Dijk, 17 janvier 2016. Original sur Wikimedia Commons ; licence CC0 1.0. Version redimensionnée par Wikimedia à 1 280 × 853 pixels, sans recadrage supplémentaire avant import. Le cadrage à l’écran peut varier selon la mise en page du site.
