Johan a épaulé 93 salariés, Johanna 96 autres, sur des exercices de bureau menés en réalité virtuelle et avec un modèle de langage identique. Au moment de partager une enveloppe de 4 francs suisses avec leur assistant, les participants ont cédé en moyenne 42 centimes de moins à l’avatar féminin.

Entre Johan et Johanna, les participants ont surtout fait la différence au moment de payer. Ils ont versé en moyenne 2,96 francs à Johan et 2,54 à Johanna, et hommes et femmes du panel ont donné moins à l’assistante - ©AntonKhrupinArt / Shutterstock
Entre Johan et Johanna, les participants ont surtout fait la différence au moment de payer. Ils ont versé en moyenne 2,96 francs à Johan et 2,54 à Johanna, et hommes et femmes du panel ont donné moins à l’assistante - ©AntonKhrupinArt / Shutterstock

On ne croyait pas si bien dire, en mars dernier, lorsqu’on vous disait que ça n’était pas facile d’être une femme dans la tech.

Des chercheurs des universités de Zurich et de Limerick et de la SKEMA Business School ont conçu cette expérience, présentée à la conférence NordiCHI, en Finlande, entre le 3 et le 7 octobre. Casque Meta Quest 3 sur la tête, chaque participant a pris place dans le bureau virtuel d’une entreprise fictive pour imaginer des solutions de management avec plusieurs assistants à tour de rôle. Tous ont travaillé avec un chatbot textuel et un petit robot de bureau, puis la moitié avec Johan et l’autre moitié avec Johanna. Après chaque exercice, ils pouvaient céder jusqu’à 4 francs à l’assistant, et chaque franc cédé était retiré de leur gain. Lors des entretiens menés ensuite, la plupart des participants questionnés ont assuré que le genre d’un assistant ne comptait pas pour eux. Les chercheurs se gardent toutefois de réduire l’écart de 42 centimes à un simple préjugé sexiste.

Des salariés plus généreux avec les assistants à visage humain

Les participants ont accordé en moyenne 2,76 francs par exercice à Johan et Johanna, contre 1,98 franc au robot de bureau. Ils ont aussi accordé davantage de confiance aux deux avatars humains, alors que les chercheurs avaient branché tous les assistants sur le modèle gpt-4-1106-preview d’OpenAI. « Avec Johanna, j’ai davantage fait confiance à la réponse, et j’ai aussi eu le sentiment qu’elle comprenait mieux ma question », a raconté l’une des personnes interrogées.

Entre Johan et Johanna, les participants ont surtout fait la différence au moment de payer. Ils ont versé en moyenne 2,96 francs à Johan et 2,54 à Johanna, et hommes et femmes du panel ont donné moins à l’assistante. Sur la confiance, en revanche, l’écart entre les deux avatars est trop faible pour être statistiquement significatif, avec une note de 5,58 sur 7 pour Johan et de 5,25 pour Johanna. « La technologie derrière ces agents d’IA était exactement la même », a rappelé Mary Hausfeld, professeure assistante à la Kemmy Business School de Limerick et coautrice de l’étude, dans un communiqué relayé par la presse RH.

Sur les 34 entretiens, seuls trois participants ont envisagé un biais dans leurs choix. « Personnellement, je pense qu’on a l’impression que ça n’a pas d’impact, mais je pense que ça en a un très fort », a estimé l’un d’eux. Un autre a balayé la question au motif qu’« une machine n’a pas vraiment de genre ». Quatre personnes ont pour leur part relié le genre de l’assistant au type de tâche. « Pour les questions interpersonnelles, je pense à une femme. Et pour les faits concrets, à un homme », a expliqué l’une d’elles, avant d’ajouter que cela ne comptait pas vraiment pour elle. Neuf autres ont même dit préférer une voix féminine, souvent par habitude des assistants vocaux du marché. Pour les auteurs, ce décalage entre les principes affichés et les versements est un « angle mort métacognitif ».

Aux yeux des participants, Johanna avait l’air moins humaine

Plus un assistant avait l’air humain, plus les participants l’ont récompensé. Ils ont noté l’humanité de Johanna à 4,59 sur 7, contre 5,09 pour Johan, et n’ont accordé que 3,47 au robot de bureau. Les auteurs ne parviennent donc pas à séparer l’effet du genre de celui de l’apparence humaine, d’autant que chaque genre était représenté par un seul avatar. D’après eux, les participants ont pu réagir à la tenue ou à la voix de Johanna. D’autres chercheurs ont montré que des personnes dénient parfois aux femmes une part de leur humanité, et l’équipe n’exclut pas une lecture genrée de cette note.

Les chercheurs ont choisi chez ElevenLabs la voix « Rachel » pour Johanna et la voix « Michael » pour Johan. La plateforme de synthèse vocale proposait alors ces deux voix par défaut pour une présentation féminine et masculine. L’équipe a aussi retenu deux avatars blancs, tirés des modèles standards de Reallusion, pour limiter les sources de variation dans un panel recruté dans un seul pays.

Les participants savaient que l’argent cédé à un assistant financerait son développement. Selon les auteurs, ces montants sont un indicateur de la valeur accordée à l’IA, pas un salaire. Ils rappellent aussi que chaque participant n’a passé qu’une trentaine de minutes avec ces assistants, et qu’une collaboration de plusieurs mois pourrait changer la donne.

L’équipe recommande malgré tout aux concepteurs d’agents d’IA de réduire les marqueurs de genre inutiles dans les personnages proposés par défaut, voire d’envisager des voix neutres. Elle note cependant qu’une partie des utilisateurs réagit mal à ces voix sans genre marqué. Les éditeurs d’assistants grand public choisissent ces voix sous l’œil du public, et OpenAI a dû retirer la voix féminine Sky de ChatGPT en mai 2024, après que Scarlett Johansson a accusé l’entreprise d’avoir imité la sienne.