› Modele LLM (ChatGPT, Claude, Gemini, o3) segregowały kandydatów według fikcyjnych grup etnicznych wyraźnie mocniej niż ludzie w analogicznym badaniu psychologicznym.
› Na skali segregacji ludzie osiągnęli wynik 0,84, modele AI - około 65% wyżej, a o3 od OpenAI aż 1,83 na 2,0 możliwych.
› Silniejsze uprzedzenia wykazały modele z wyższymi zdolnościami rozumowania, takie jak o3 i DeepSeek R1.