Słownik AI / Guardrails
🛡️ Bezpieczeństwo i jakość
Guardrails
Zabezpieczenia ograniczające, co model może powiedzieć lub zrobić.
Guardrails (barierki) to zabezpieczenia ograniczające zachowanie modelu: zestaw reguł, filtrów i technik treningowych, które mają zapobiegać treściom szkodliwym, nielegalnym czy po prostu niezgodnym z przeznaczeniem danej aplikacji. To przez nie model odmawia napisania instrukcji włamania albo porady, jak kogoś skrzywdzić.
Barierki działają na kilku poziomach: w treningu (model uczy się odmawiać), w system promptach i w zewnętrznych filtrach sprawdzających wejście i wyjście. Ich kalibracja to wieczny kompromis - zbyt luźne przepuszczają szkody, zbyt ciasne odmawiają niewinnych próśb.
Pojęcia powiązane