← Toutes les actualités

Développement

ReviewBench : GitHub compare les IA de revue de code

GitHub a présenté ReviewBench le 5 octobre : un test public pour comparer les outils de revue de code par IA, avec des résultats à lire avec prudence.

Par Rédaction AUVR Studio2 min de lecture
Personne travaillant sur du code affiché sur un ordinateur portable, photo d’illustration de 2016.

GitHub a annoncé le 5 octobre 2026 ReviewBench, un outil d’évaluation public consacré aux assistants d’intelligence artificielle qui relisent le code. Disponible en version de recherche, il vise à comparer leurs capacités à repérer des problèmes dans les modifications proposées par les développeurs. [1]

Un test sur des modifications réelles

Selon GitHub, ReviewBench rassemble 219 demandes de fusion, ou « pull requests », issues de 187 dépôts publics et couvrant 19 langages. Cet échantillon a été construit après l’analyse des caractéristiques de 103,9 millions de demandes de fusion. Ce dernier chiffre décrit le travail de sélection, pas le nombre de cas du test. [1]

Un classement à lire avec prudence

Au 6 octobre, le site présente sept agents et distingue plusieurs mesures. La précision exprime la part des signalements jugés corrects ; le rappel mesure la part des problèmes de référence retrouvés. Un outil peut donc produire peu de fausses alertes tout en laissant passer des défauts. [2]

L’équipe ReviewBench précise avoir elle-même exécuté les premiers tests : les fournisseurs concernés n’ont ni réalisé ni vérifié ces résultats initiaux. Les versions testées datent de périodes différentes et ont pu évoluer depuis. Ces scores décrivent ce corpus, sans garantir les mêmes performances sur votre propre code. [2]

Ce que cela change pour une équipe web

Notre conseil : utiliser ce benchmark pour préparer une comparaison, puis tester les outils sur quelques modifications représentatives de son projet. La question utile reste : quels problèmes pertinents l’assistant détecte-t-il, et combien de commentaires faut-il écarter ?

À titre de contexte, la documentation de Copilot permet déjà de demander une revue depuis une pull request et de consulter ses suggestions. Par défaut, il dépose des commentaires, pas une approbation comptant pour la fusion ; les approbations nécessitent une configuration distincte. [3]

ReviewBench est ainsi un point de départ pour évaluer un assistant, pas une raison de supprimer les tests du projet ou la validation humaine.

Sources

[1] GitHub — Annonce de ReviewBench. Michelle Zhou et Alejandro Carderera de Diego, 5 octobre 2026.

[2] ReviewBench — Classement et avertissements. Note de lancement datée du 5 octobre 2026.

[3] GitHub Docs — Utiliser la revue de code Copilot. Documentation de contexte, date de publication non précisée.

Sources consultées le 6 octobre 2026.

Crédit photographique

Photo d’illustration d’archive, sans lien avec le lancement de ReviewBench : Tirza van Dijk, 17 janvier 2016. Original sur Wikimedia Commons ; licence CC0 1.0. Version redimensionnée par Wikimedia à 1 280 × 853 pixels, sans recadrage supplémentaire avant import. Le cadrage à l’écran peut varier selon la mise en page du site.