NeoMME - nowy enkoder multimodalny od Hcompany
Hcompany opublikowało na Hugging Face model NeoMME - lekki enkoder multimodalny i wielojęzyczny o wielkości 0,3 miliarda parametrów.
👁 124 przeczytań
Firma Hcompany opublikowała na platformie Hugging Face model NeoMME - enkoder zaprojektowany do jednoczesnej obsługi wielu modalności i wielu języków, ważący zaledwie 0,3 miliarda parametrów.
NeoMME należy do kategorii modeli do ekstrakcji cech (Feature Extraction), co oznacza, że jego głównym zastosowaniem jest reprezentowanie danych - tekstów, obrazów lub ich kombinacji - w postaci wektorów liczbowych. Takie wektory służą następnie do wyszukiwania semantycznego, klasyfikacji czy budowania systemów rekomendacji.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Multimodalny od podstaw
Kluczowy aspekt modelu to podejście określane jako multimodal-native. W praktyce oznacza to, że NeoMME nie powstał jako model językowy, do którego dorobiono obsługę obrazów - od samego początku był trenowany z myślą o różnych typach danych jednocześnie. To istotna różnica architektoniczna wobec wielu popularnych enkoderów, które obsługują modalności sekwencyjnie lub traktują obraz jako token dodany do tekstu.
Wielojęzyczność modelu sprawia, że powinien radzić sobie z reprezentowaniem treści w różnych językach bez konieczności przekładania wszystkiego na angielski przed przetwarzaniem - problem, który wciąż dotyka wiele komercyjnych systemów wyszukiwania semantycznego.
Rozmiar 0,3 mld parametrów plasuje NeoMME w segmencie lekkich, wydajnych modeli. To świadomy wybór: mniejsze enkodery można uruchamiać taniej i szybciej, co ma znaczenie przy systemach przetwarzających duże wolumeny dokumentów lub działających z ograniczeniami sprzętowymi. W ekosystemie Hugging Face modele tej klasy często trafiają do zastosowań produkcyjnych szybciej niż ich większe odpowiedniki.
Hcompany to stosunkowo młoda firma, a NeoMME jest jej pierwszą szerzej dostępną publikacją na Hugging Face - model zebrał już kilkadziesiąt pobrań w ciągu kilku godzin od pojawienia się na platformie.
Dla deweloperów budujących wielojęzyczne systemy RAG (Retrieval-Augmented Generation) lub wyszukiwarki semantyczne obsługujące zarówno tekst, jak i obrazy, taki model może być ciekawą alternatywą wobec droższych API od większych dostawców - pod warunkiem, że wyniki na benchmarkach okażą się konkurencyjne. Hcompany na razie nie opublikowała szczegółowych wyników ewaluacji, co będzie pierwszym pytaniem, jakie zadadzą praktycy rozważający wdrożenie.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
DeepSeek wypuścił eksperymentalny model multimodalny - rywal Opusa 4.8 od AnthropicNewsy
Modele multimodalne uczą się dokumentów, zdjęć i ekranu. Praca z plikiem przestaje być liniowaPremium
Multimodalne modele AI zmieniają rynek pracy - Które zawody znikną jeszcze w tym roku?Publicystyka
