Les modèles d'IA évaluent-ils les visages comme les humains ?
Nous avons comparé les jugements d'un modèle à ceux d'évaluateurs humains sur un jeu de données public. La concordance est élevée pour la moyenneté et la symétrie, plus faible pour le charme.
Pourquoi nous avons posé la question
Notre chaîne de traitement rédige chaque rapport avec un modèle de vision avant qu'un humain ne le relise. Si les jugements du modèle s'écartent de la perception humaine, l'étape humaine doit le détecter. Nous voulions savoir où se situe cet écart.
Ce que nous avons fait
Nous avons pris 500 portraits de face issus d'un jeu de données de recherche public, constitué avec consentement et accompagné de notes d'attractivité attribuées par des humains, nous y avons appliqué nos instructions d'évaluation et avons comparé les scores du modèle, caractéristique par caractéristique, aux moyennes humaines.
Ce que nous avons constaté
- Moyenneté et symétrie : corrélation supérieure à 0,8. Le modèle voit ce que voient les gens.
- Qualité de la peau : forte concordance, un peu plus sévère que les évaluateurs humains sur la texture.
- Dimorphisme : bonne concordance pour les hommes, plus faible pour les femmes, chez qui le modèle surpondère la largeur de la mâchoire.
- « Charme » et expression : faible concordance. Les humains valorisent la chaleur d'une manière que les modèles ne mesurent pas.
Ce que cela signifie pour votre rapport
Les parties mesurées d'un rapport Faciem sont fiables. Les parties consacrées à l'expression, à l'unicité et au charme sont rédigées par l'analyste qui relit le rapport, et non par le modèle. Cette répartition est délibérée.