CineMR: model AI do ilościowej oceny serca z MRI, który sam wywołuje narzędzia
Badacze stworzyli model CineMR łączący duży model językowy z narzędziami do analizy obrazów MRI serca. Osiąga on 35,9% poprawnych odpowiedzi przy pierwszej próbie, podczas gdy bazowy model Qwen3-VL-8B uzyskuje zaledwie 1,5%.

👁 117 przeczytań
Rezonans magnetyczny serca (CMR), w tym obrazowanie cine, jest uznawany za standard nieinwazyjnej oceny budowy serca i funkcji komór. Interpretacja takich badań wymaga połączenia oceny wizualnej z pomiarami ilościowymi: objętości komór, frakcji wyrzutowej, masy mięśnia sercowego, grubości ścian i regionalnego ruchu ścian. Problem polega na tym, że istniejące medyczne modele językowe z wizją (VLM) nie potrafią w sposób niezawodny wydobywać takich danych z wielowymiarowych obrazów cine bez wsparcia narzędzi analitycznych.
Co to jest CineMR i jak działa
CineMR to model VLM rozszerzony o możliwość wywoływania zewnętrznych narzędzi do analizy obrazów serca. Model może korzystać z narzędzi do segmentacji, wyboru fazy, wolumetrii, morfometrii oraz analizy regionalnego ruchu ścian. Wyniki tych narzędzi są wplatane bezpośrednio w tok rozumowania modelu - stąd nazwa „tool-integrated reasoning„. Autorzy zbudowali też własny benchmark do oceny modeli: wieloośrodkowy zestaw pytań i odpowiedzi dotyczących wydobywania miar ilościowych, diagnozy wieloklasowej i diagnozy różnicowej.
Jak model był trenowany
Trening przebiegał dwuetapowo. Najpierw zastosowano nadzorowane dostrajanie (SFT) na śladach interakcji z narzędziami. Następnie użyto metody Group Relative Policy Optimization (GRPO) z nagrodami za warunkowe korzystanie z narzędzi. Po etapie SFT poprawność wywoływania narzędzi wynosiła 78,9%, a po GRPO wzrosła do 99,8%.
Wyniki na benchmarku
Na wieloośrodkowym benchmarku cine CMR CineMR osiągnął 35,9% pass@1 (poprawna odpowiedź przy pierwszej próbie) oraz 58,9% pass@4 (poprawna odpowiedź w czterech próbach). Dla porównania bazowy model Qwen3-VL-8B uzyskał 1,5% pass@1, LLaVA-Med v1.5 - 0,0% pass@1, a MedGemma-4B - 7,0% pass@1.
Autorzy sprawdzili też, ile wnoszą same narzędzia. Wyniki narzędzi na żywo poprawiły dokładność pomiarów komorowych o 20,4-23,7% w porównaniu z bezpośrednimi przewidywaniami modelu. Usunięcie wszystkich narzędzi obniżyło pass@1 z 35,9% do 27,9%.
Dostępność zasobów
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Autorzy informują, że kod, zasoby benchmarku i wagi modelu są publicznie dostępne pod adresem podanym w pracy. Praca pochodzi z 1 października 2026 roku i została złożona przez Kunyang Li oraz ośmioro współautorów.
Dokument nie zawiera informacji o tym, czy model był testowany w warunkach klinicznych, jakie są plany wdrożenia ani czy przeszedł jakąkolwiek walidację regulacyjną.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co z tego wynika
Moim zdaniem najważniejszy wniosek z tego dokumentu jest taki, że sam duży model wizyjny - nawet dobry - jest bezużyteczny do ilościowej diagnostyki kardiologicznej: 1,5% skuteczności bazowego modelu to wynik praktycznie losowy. Dopiero połączenie modelu z wyspecjalizowanymi narzędziami analitycznymi daje coś użytecznego. To sugeruje, że w medycynie obrazowej droga do AI nie prowadzi przez coraz większe modele ogólne, lecz przez ścisłą integrację modeli językowych z domenowymi narzędziami obliczeniowymi. Wynik 35,9% pass@1 to wciąż daleko od klinicznej użyteczności, ale autorzy nie twierdzą, że model jest gotowy do wdrożenia - prezentują go jako obiecujące podejście wspomagające, co uważam za uczciwe postawienie sprawy.
Źródło: arXiv cs.AI: CineMR: Tool-Integrated Vision-Language Reasoning for Quantitative Cardiac MRI Assessment (dokument z 2026-10-02). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
