DeepSeek wypuścił eksperymentalny model multimodalny - rywal Opusa 4.8 od Anthropic
DeepSeek udostępnił w piątek eksperymentalny model multimodalny V4-Flash-Vision-Exp, deklarując jego wydajność agentową zbliżoną do Anthropic Opus 4.8.
👁 136 przeczytań
DeepSeek udostępnił w piątek eksperymentalny model multimodalny DeepSeek-V4-Flash-Vision-Exp, rozszerzający tekstowy V4-Flash o zdolność odczytywania obrazów i zrzutów ekranu. Model jest już dostępny na platformie API firmy, a jednocześnie DeepSeek wypuścił wersję 0.1.1 swojego narzędzia agentowego z wbudowaną obsługą nowego modelu.
Firma porównała jego wyniki z Anthropic Opus 4.8, twierdząc, że multimodalna wydajność agentowa jest „bliska” temu modelowi. Opublikowana tabela benchmarków pokazuje jednak nieco inny obraz: DeepSeek wygrywa tylko w trzech z jedenastu testów - m.in. DeepSWE o 1,3 pkt i Agents’ Last Exam o 1,6 pkt. Na dwóch benchmarkach przegrywa wyraźnie: NL2Repo 57,7 vs 69,7 i DSBench-Hard 63,6 vs 71,7.
Zobacz wpis na X
Jest też ważny asterisk: DeepSeek sam zaznaczył w przypisach, że w dwóch testach tekstowy V4-Flash „ignoruje multimodalne elementy” - czyli był oceniany na zadaniach z obrazami, których nie widział. To tłumaczy część efektownej różnicy między starym a nowym modelem. Warto dodać, że porównania z nowszym Claude Opus 5, który pojawił się 24 lipca, DeepSeek w ogóle nie przeprowadził.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


