› Dzisiaj w świecie AI dużo działo się zarówno na froncie nowych modeli, jak i regulacji oraz etyki.
› Google DeepMind zaskoczyło kolejnym wydaniem Gemini, Anthropic rozgrzewa rynek spekulacjami o rekordowym IPO, a naukowcy i organizacje strażnicze przyglądają się bliżej bezpieczeństwu i transparentności systemów AI.
› Bezpieczne uczenie ze wzmocnieniem bez etykiet per krok - metoda RCI Uczenie ze wzmocnieniem w trybie offline napotyka praktyczny problem - ludzie zazwyczaj podają jedynie sygnał stopu na końcu trajektorii, a nie ocenę bezpieczeństwa dla każdego kroku z osobna.
› Badacze z Uniwersytetu Witwatersrand proponują metodę RCI, która przekształca ten rzadki sygnał w gęste adnotacje przypisane do poszczególnych kroków.