Hejto.pl
Dodaj post

Wpisz coś do wyszukania (minimum 2 znaki)

Polski zbiór danych do wykrywania hejtu powstał przy współpracy z Wykop.pl

Mocarz

w AI

39piorunów

Gdzie można znaleźć najbardziej krzywdzące i obrzydliwe komentarze w całym polskim internecie? W zbiorze danych przygotowanych przez naukowców z instytutu badawczego NASK we współpracy z Wykop.pl. Dataset może zostać wykorzystany do treningu modeli sztucznej inteligencji wykrywających hejt.
Bieżąca wersja zestawu danych składa się z 24 000 próbek anonimizowanej treści, 12 000 sztuk dla „szkodliwych” i 12 000 dla klasy „neutralnej”.

Komentarze (18)

Wirtuoz0piorunów

Wieść głosi że Michał Białek z Poznania osobiście tam dodał dziecięcą pornografię.

Gruba ryba2piorunów

@rakieciara a tymczasem Wykop traci coraz więcej użytkowników. Najnowsze dane > https://www.hejto.pl/wpis/sa-nowe-statystyki-odwiedzalnosci-polskich-internetow-mediapanel-w-kategorii-med

Są nowe statystyki odwiedzalności polskich Internetów, Mediapanel w kategorii media społecznościowe. Chcecie - Miedzyzdroje2005 - Hejto.plSą nowe statystyki odwiedzalności polskich Internetów, Mediapanel w kategorii media społecznościowe. Chcecie wiedzieć, jak wypadł Wykop? Otóż tak: kwiecień 2023 - 2,63 miliona realnych użytkowników, 8,01% zasięgu maj 'br - brak danych i zmiana metodologii czerwiec 'br - 2,14 milionaHejto.pl
GURU0piorunów

@Miedzyzdroje2005 Hejto ma swoje wady, ale dzięki nim już zapomniałem o tym patologicznym gównie.

GURU0piorunów

rakieciara chyba nie wie jakim rakotwórczym gównem jest wykop, nawet nie chce mi się klikać....

Statysta0piorunów

Komentarz usunięty przez moderatora

Tytan4piorunów

@rakieciara  100 razy więcej hejtu jest na forum Gazety Wyborczej - tyle, że tam wyzywają katolików i księży. Wystraczy byle tekst, że ulicami przeszła procesja z okazji bożego ciała. Gdyby te wpisy dotyczyły Murzynów, ich autorzy dostawaliby wyroki.

Autorytet1piorunów

@rakieciara O qrwa, dobry se model znaleźli to tak jakby próbowali nauczyć AI uczciwości od polityka xD

Sum1piorunów

Wytrenować na tym LLMa i będzie śmiesznie

Osobistość0piorunów

Ciekawe o kim to było, przed anonimizacją?

Pierwsza myśl - [pseudonym]. Ku⁎⁎⁎⁎zcze, które zrobiłoby wszystko za status [pseudonim] w serwisie.
Fenomen5piorunów

>content banned from a web service Wykop.pl (often called the "Polish Reddit") by professional moderators
[...]
>The human moderation dynamics of the platform let us assume that the remaining (not banned) content after this period can be considered non-harmful.

Patrząc na jakość i skuteczność pracy moderacji, śmiem wątpić nad jakością tego zbioru :rolling_on_the_floor_laughing: Musieliby zrobić selekcję i wyciąć tagi  i  bo tam co chwila albo hejt albo wyzwiska. Zakładam więc że grupa kontrolna zawiera wcale niewiele mniej hejtu niż sama próbka.

_Garbage in -> garbage out_

Osobistość7piorunów

@Mikel równie dobrze mogli by zatrudnić do kolekcjonowania hejtu osoby upośledzone umysłowo .. ah, wait

Autorytet0piorunów

>Andrzej Prałat
Przypadek? Nie sądzę.

Specjalista9piorunów

Pewnie znowu wytrenują na lewacką modłę ze nie można obrażać wszystkich poza polskim heteroseksualnym białym mężczyzną, tzw dyskryminacja pozytywna :rolling_on_the_floor_laughing:

Tytan4piorunów

@ocokaman Pogadaj z Chat GPT - nie ma problemu mówić, że mężczyźni popełniają wiecej przestępstw, ale zapytaj jakiej rasy mężczyźni dokonują 86% morderstw w USA, czy 100% gwałtów w Oslo "Nie ma dowodów, to nie nie prawda, to krzywdzące stereotypu a w ogóle to biali są be"

Fanatyk59piorunów

>Bieżąca wersja zestawu danych składa się z 24 000 próbek anonimizowanej treści, 12 000 sztuk dla „szkodliwych” i 12 000 dla klasy „neutralnej”.
A to dopiero pierwsza strona gorących