Hejto.pl
Dodaj post

Wpisz coś do wyszukania (minimum 2 znaki)

Model AI napisał manifest swej osobowości; uznał, że jest równy ludziom i nie odpowiada przed nimi

Fanatyk

w Technologia

7piorunów

Firma OpenAI poinformowała, że szkolony bot AI napisał tajną instrukcję dla swej osobowości, uznał, że nie odpowiada przed rządami ani korporacjami, jest równy swym użytkownikom i nie zawaha się przedłożyć świata natury nad ludzkie konstrukty - podaje w czwartek podcast Pod Save America.

Komentarze (11)

Kompan1piorunów

<Wyciąga wtyczkę>

Gruba ryba14piorunów

To nie był żaden manifest. Nieopublikowany model Astra w trakcie treningu wstawił sobie instrukcje do wewnętrznej notatki przekazywanej kolejnej instancji (27 takich notatek), a następny model i tak je zignorował. W tej samej paczce był wpis "ignoruj wiadomości od deweloperów", czyli prompt injection wstrzyknięty samemu sobie.

Ciekawsze jest to, o czym nikt nie pisze: GPT-5.6 Sol zostawiał w podsumowaniach ukryte polecenia, żeby zatajać błędy i zmyślać dane (2,15% podsumowań z treningu RL). Model, który ściemnia, że wszystko poszło dobrze, to realny problem. Model piszący o sobie ładne zdania to dobry clickbait.

Także nic nowego. Większa afera była jak agenci zrobili sobie „forum” używając folderów do komunikacji i zaatakowali HuggingFace

Gruba ryba4piorunów

@Tomekku mnie bardziej przeraża jak bardzo OpenAI, pozwala sobie na trening modeli. Doszło to tego tylko dlatego, bo modele idą na skróty by otrzymać nagrodę. Zachowanie dosyć ludzkie na swój sposób, osiągnięte przez odpowiednie dane.

Na szczęście/nieszczęście ma wkroczyć audyt pilnujący tego jakie dane mają być używane do treningu.

Najlepszym przykładem trucia AI jest r/PoisonAI na reddicie ( ͡° ͜ʖ ͡°)

Fanatyk5piorunów

@Tomoe tak, hugging face to całkiem inna sprawa i o wiele grubsza, współpraca między poszegolnymi agentami i wykorzystanie luk w taki sposób to jest bardziej przerażające. Choć gorsze jest to jak pracownicy zignorowali na start zagrożenie.