Notes Odoo, IA, méthode.
5 articles pour « benchmarks »
Le code IA sort plus vite, sa revue prend cinq fois plus de temps
Les assistants font écrire plus vite, mais la relecture reste humaine. Les études 2026 de Faros AI et LinearB montrent un temps de revue qui explose et des pull requests plus grosses. Pour une PME, la capacité de relecture devient le vrai plafond de livraison.
Quand l’agent de code annonce « terminé » à tort
Un agent de code qui annonce « terminé » n’a pas forcément résolu la tâche. Deux études publiées en 2026 chiffrent ces fausses réussites, souvent invisibles car le code passe les tests. Pour une PME, le coût réel se déplace vers la correction humaine.
SWE-bench à 95 % : ce que le score d'un agent de code ne dit pas
Un éditeur affiche 95 % sur SWE-bench pour vendre son agent de code. Ce benchmark est pourtant saturé et contaminé, au point qu'OpenAI a cessé de le publier début 2026. On explique comment lire ces scores avant de choisir un outil.
Le code que les agents IA produisent vieillit mal
Un benchmark publié cette semaine mesure ce que devient le code des agents IA après dix itérations. Verdict : il se dégrade quand le code humain, lui, reste stable. Conséquences pour qui maintient du logiciel Odoo dans la durée.
Les agents de codage passent à l'échelle industrielle
Skill-creator avec des evals, Copilot CLI en v1.0, GPT-5.4 dans Copilot : la semaine a été chargée côté outillage. Ce qui change concrètement pour les équipes qui shipent.