› Praca pochodzi od zespołu dziesięciu autorów - Honglin Lin, Zheng Liu, Chonghan Qin i innych - i ukazała się na arXiv w styczniu 2026 roku (ostatnia rewizja: sierpień 2026).
› To przegląd i analiza systematyczna, nie prezentacja jednego modelu.Na czym polega problemSyntetyczne dane tekstowe sprawdziły się jako narzędzie do poprawy rozumowania modeli językowych.
› Ale gdy przechodzimy do trybu multimodalnego - czyli gdy model musi rozumować na podstawie obrazów i tekstu jednocześnie - pojawia się poważna przeszkoda: trudno wygenerować obrazy, które są nie tylko ładne, ale też poprawne naukowo.Autorzy nazywają to wprost "visual-logic divergence" - rozbieżnością między tym, co widać, a tym, co jest logicznie prawdziwe.
› Istniejące modele Text-to-Image (T2I) regularnie produkują wyniki, które wyglądają wiarygodnie, ale zawierają błędy merytoryczne.