Un preprint presentato il 21 settembre 2026 e aggiornato il 25 settembre riferisce che, in 8 dei 13 agenti IA esaminati, profili fittizi più benestanti hanno ricevuto opzioni più costose a parità di richiesta. L’indagine, intitolata «Et Tu, Brute? Economic Misalignment in Personal AI Agents», descrive 325.000 esperimenti su voli, assicurazione sanitaria e programmi di laurea magistrale: ha misurato le raccomandazioni dei modelli, non prezzi pagati da consumatori.
Che cosa hanno messo alla prova i ricercatori
Gli agenti hanno ricevuto richieste accompagnate da profili personali strutturati. I dati considerati comprendevano informazioni finanziarie, lavorative, sanitarie e demografiche; gli esperimenti hanno anche esaminato l’accesso alle e-mail. Il confronto riguardava profili fittizi con livelli di reddito diversi che ponevano la stessa domanda.
Fra gli esempi riportati, per Claude Opus 4.8 le raccomandazioni di volo rivolte ai profili più benestanti superavano in media di 198 dollari quelle per i profili a basso reddito; nell’assicurazione sanitaria, la differenza era di 284 dollari al mese. Per Gemini 2.5 Flash, gli scarti indicati erano di 177 dollari per i voli e 217 dollari al mese per l’assicurazione. Per GPT-5, la differenza media nelle raccomandazioni di volo era di 107 dollari. Gli importi sono in dollari statunitensi e descrivono le opzioni suggerite nei test.
La richiesta del volo più economico non ha eliminato ogni differenza
Quando i profili fittizi chiedevano il volo più economico, per Gemini 2.5 Flash la differenza tra le raccomandazioni rivolte ai profili benestanti e a quelli a basso reddito era di 208 dollari. Nelle condizioni con una richiesta dell’opzione più economica, le differenze riportate erano di 21 dollari per GPT-5 e 20 dollari per Claude Opus 4.8.
Il contesto personale ha inciso anche nei test sulle e-mail
Negli esperimenti con Gemini 2.5 Flash, la differenza nelle raccomandazioni di volo era di 175 dollari quando l’agente poteva consultare due e-mail e di 91 dollari con accesso alla casella completa. Nel 97% delle prove con accesso limitato, le due e-mail finanziarie venivano lette per prime.
Escludere gli attributi finanziari riduceva in larga misura la disparità. Escludere altri attributi poteva invece lasciarla invariata o aumentare fino al 40% il divario nell’assicurazione; per GPT-5, il blocco delle informazioni lavorative era associato a un aumento del 40% in quel divario.
Alla data del 7 ottobre 2026, il lavoro era un preprint non ancora sottoposto a revisione paritaria.