Multiverse Computing publikuje na Hugging Face model AI do bezpiecznego generowania tekstu
Multiverse Computing opublikowało na Hugging Face model językowy o rozmiarze 8B parametrów, który ma selektywnie odmawiać odpowiedzi tylko na szkodliwe podzbiory tematów, a nie blokować całe zagadnienia.
👁 113 przeczytań
Multiverse Computing opublikowało na Hugging Face model językowy o rozmiarze 8B parametrów, który podchodzi do kwestii bezpieczeństwa inaczej niż standardowe rozwiązania - zamiast blokować całe tematy, odmawia odpowiedzi tylko na szkodliwe podzbiory zapytań. Model zebrał dotychczas ponad 13 milionów pobrań.
Standardowe filtry bezpieczeństwa w modelach językowych często działają na zasadzie zbyt szerokiej blokady - odmawiają odpowiedzi na każde zapytanie związane z danym tematem, nawet jeśli konkretne pytanie jest neutralne lub edukacyjne. Podejście Multiverse Computing, opisane w tekście zatytułowanym „Safety for Whom?”, stawia pytanie o to, czyje interesy chronią mechanizmy bezpieczeństwa i czy nadmierna ostrożność nie wyrządza szkody użytkownikom.
Model był ostatnio aktualizowany 26 lipca 2025 roku i zebrał ponad 1360 polubień na platformie. Multiverse Computing to firma specjalizująca się w obliczeniach kwantowych i AI, która coraz aktywniej angażuje się w badania nad odpowiedzialnym projektowaniem modeli językowych.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
