Rozpoznawanie bengalskiego języka migowego na smartfonie - nowy zbiór danych i lekki model
Bangladescy badacze stworzyli zbiór 10 874 zdjęć gestów bengalskiego języka migowego, zweryfikowanych przez ekspertów, oraz lekki model sieci neuronowej działający na zwykłym smartfonie. Model waży po kwantyzacji zaledwie 0,48 MB i rozpoznaje gest w 3,98 ms.
👁 121 przeczytań
Artykuł opisuje pracę dwóch autorów - Saada Ahmeda i Md Khalida Syfullaha - opublikowaną 6 sierpnia 2026 roku. Dotyczy automatycznego rozpoznawania bengalskiego języka migowego (BdSL) na urządzeniach mobilnych, z myślą o osobach głuchych i niedosłyszących w Bangladeszu.
Problem z dotychczasowymi zbiorami danych
Autorzy wskazują dwa główne braki istniejących rozwiązań. Po pierwsze, dotychczasowe zbiory danych powstawały w kontrolowanych warunkach laboratoryjnych i nie były weryfikowane przez ekspertów od języka migowego. Po drugie, stosowane modele opierały się na ciężkich sieciach wstępnie trenowanych na ImageNet, które nie nadają się do uruchomienia bezpośrednio na telefonie.
Nowy zbiór danych RSBdSL38
Autorzy stworzyli zbiór o nazwie RSBdSL38, zawierający 10 874 obrazy obejmujące wszystkie 38 znaków ręcznych BdSL, które odpowiadają 51 literom alfabetu bengalskiego. Zdjęcia wykonano od prawdziwych użytkowników języka migowego w trzech szkołach specjalnych w Bangladeszu. Każdy obraz przeszedł weryfikację ekspercką. Zbiór danych, kod i modele zostały udostępnione publicznie.
Lekki model oparty na mechanizmie uwagi
Zaproponowana sieć neuronowa ma 298 470 parametrów i została zaprojektowana od podstaw - bez wstępnego trenowania na zewnętrznych zbiorach. Składa się z grupowanych bloków resztkowych z wąskim gardłem, mechanizmów uwagi kanałowej i przestrzennej, wieloskalowego bloku cech ręki, podwójnego poolingu oraz aktywacji Swish.
Na własnym zbiorze RSBdSL38 model osiąga dokładność 96,37% (95,72% plus minus 0,54% w pięciu uruchomieniach z różnym ziarnem losowości). Dla porównania - najlepszy spośród dziewięciu architektur wstępnie trenowanych na ImageNet, testowanych w identycznym protokole, osiąga wynik wyższy o zaledwie 1,08 punktu procentowego, używając przy tym od 8,5 do 68 razy więcej parametrów i od 1,3 do 21,7 razy więcej operacji zmiennoprzecinkowych (MACs).
Wyniki na innych zbiorach i testy odporności
Po dotrenowaniu na sześciu publicznych zbiorach BdSL model uzyskuje wyniki od 92,95% do 98,33%. Na połączonym zbiorze osiąga 97,04%. W trybie zero-shot (bez żadnego dotrenowania) na zbiorze BdSL-38 wynik wynosi 76,25%. Test z podziałem niezależnym od sygnatariuszy - gdzie 6 z 36 osób migających zostało całkowicie wykluczonych z treningu - daje 85,18%.
Autorzy przeprowadzili też analizę ablacji: usunięcie dowolnego etapu architektury kosztuje od 7,61 do 89,30 punktów procentowych dokładności, podczas gdy zmiany w samej procedurze treningu kosztują co najwyżej 3,17 punktu. Wizualizacje Grad-CAM z testami usuwania-wstawiania oraz losowania wag potwierdzają, że model faktycznie skupia się na dłoni wykonującej gest, a nie na artefaktach tła.
Działanie na smartfonie
Po kwantyzacji model zajmuje 0,48 MB i działa w czasie 3,98 ms na obraz przy całkowitym śladzie pamięciowym 15,5 MB na zwykłym smartfonie klasy konsumenckiej. Autorzy nie podają nazwy ani modelu użytego urządzenia.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co z tego wynika
Moim zdaniem ta praca jest wartościowa przede wszystkim dlatego, że rozwiązuje konkretny, lokalny problem dostępności - i robi to bez kopiowania gotowych, ciężkich modeli z Zachodu. Zebranie danych w prawdziwych szkołach specjalnych i ich ekspercka weryfikacja to element, którego w akademickich zbiorach często brakuje. Imponuje też to, że model trenowany od zera jest praktycznie tak dobry jak pretrenowane giganty, a przy tym zmieści się w każdym telefonie. Słabym punktem jest brak informacji o tym, jak model radzi sobie w praktyce - artykuł mierzy dokładność klasyfikacji na zbiorach testowych, ale nic nie mówi o wdrożeniu w realnej aplikacji ani o ocenie użytkowników. To wciąż etap badawczy, nie gotowy produkt.
Źródło: arXiv cs.AI: Toward Deployable Bangla Sign Language Recognition with Expert-Validated Data and a Lightweight Attention-Based Model (dokument z 2026-08-07). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


