RT Petit Poney de Findus"GPT-5.5(niveau le + élevé de raisonnement) obtient un score de 10,6% sur le dataset ActiveVision tandis que les humains atteignent 96,1%;Fable:3,5%Ce qui est intéressant dans ce preprint ce n’est pas tant qu’un modèle de vision avancé ait échoué à un nouveau benchmark (ça arrive chaque semaine) mais la nature spécifique de cet échec et le fait que les modèles ne parviennent pas à y remédier en écrivant leur propre code:ActiveVision comprend 17 tâches réparties en 3 catégories conçues pour « imposer une perception visuelle répétée plutôt qu’une description statique unique » (termes des auteurs)."#LLM #IA #benchmarks https://bsky.app/profile/0xdefec7edcafe.bsky.social/post/3mrfljj3uys2s
RT Petit Poney de Findus"GPT-5.5(niveau le + élevé de raisonnement) obtient un score de 10,6% sur le dataset ActiveVisio...