
Polski zbiór danych do wykrywania hejtu powstał przy współpracy z Wykop.pl
rakieciaraMocarz
39piorunówGdzie można znaleźć najbardziej krzywdzące i obrzydliwe komentarze w całym polskim internecie? W zbiorze danych przygotowanych przez naukowców z instytutu badawczego NASK we współpracy z Wykop.pl. Dataset może zostać wykorzystany do treningu modeli sztucznej inteligencji wykrywających hejt.
Bieżąca wersja zestawu danych składa się z 24 000 próbek anonimizowanej treści, 12 000 sztuk dla „szkodliwych” i 12 000 dla klasy „neutralnej”.
Komentarze (18)
Wieść głosi że Michał Białek z Poznania osobiście tam dodał dziecięcą pornografię.
@rakieciara a tymczasem Wykop traci coraz więcej użytkowników. Najnowsze dane > https://www.hejto.pl/wpis/sa-nowe-statystyki-odwiedzalnosci-polskich-internetow-mediapanel-w-kategorii-med
Są nowe statystyki odwiedzalności polskich Internetów, Mediapanel w kategorii media społecznościowe. Chcecie - Miedzyzdroje2005 - Hejto.plSą nowe statystyki odwiedzalności polskich Internetów, Mediapanel w kategorii media społecznościowe. Chcecie wiedzieć, jak wypadł Wykop? Otóż tak: kwiecień 2023 - 2,63 miliona realnych użytkowników, 8,01% zasięgu maj 'br - brak danych i zmiana metodologii czerwiec 'br - 2,14 milionaHejto.pl@Miedzyzdroje2005 i dobrze
@Miedzyzdroje2005 Hejto ma swoje wady, ale dzięki nim już zapomniałem o tym patologicznym gównie.
rakieciara chyba nie wie jakim rakotwórczym gównem jest wykop, nawet nie chce mi się klikać....
@Opornik gówno można sprzedać
Komentarz usunięty przez moderatora
@rakieciara 100 razy więcej hejtu jest na forum Gazety Wyborczej - tyle, że tam wyzywają katolików i księży. Wystraczy byle tekst, że ulicami przeszła procesja z okazji bożego ciała. Gdyby te wpisy dotyczyły Murzynów, ich autorzy dostawaliby wyroki.
@rakieciara O qrwa, dobry se model znaleźli to tak jakby próbowali nauczyć AI uczciwości od polityka xD
Wytrenować na tym LLMa i będzie śmiesznie
Ciekawe o kim to było, przed anonimizacją?
Pierwsza myśl - [pseudonym]. Ku⁎⁎⁎⁎zcze, które zrobiłoby wszystko za status [pseudonim] w serwisie.
>content banned from a web service Wykop.pl (often called the "Polish Reddit") by professional moderators
[...]
>The human moderation dynamics of the platform let us assume that the remaining (not banned) content after this period can be considered non-harmful.
Patrząc na jakość i skuteczność pracy moderacji, śmiem wątpić nad jakością tego zbioru :rolling_on_the_floor_laughing: Musieliby zrobić selekcję i wyciąć tagi #blackpill i #patostreamy bo tam co chwila albo hejt albo wyzwiska. Zakładam więc że grupa kontrolna zawiera wcale niewiele mniej hejtu niż sama próbka.
_Garbage in -> garbage out_
@Mikel równie dobrze mogli by zatrudnić do kolekcjonowania hejtu osoby upośledzone umysłowo .. ah, wait
>Andrzej Prałat
Przypadek? Nie sądzę.
Pewnie znowu wytrenują na lewacką modłę ze nie można obrażać wszystkich poza polskim heteroseksualnym białym mężczyzną, tzw dyskryminacja pozytywna :rolling_on_the_floor_laughing:
@imie-nazwisko jakim huem Si zaprzecza faktom xD
@ocokaman Pogadaj z Chat GPT - nie ma problemu mówić, że mężczyźni popełniają wiecej przestępstw, ale zapytaj jakiej rasy mężczyźni dokonują 86% morderstw w USA, czy 100% gwałtów w Oslo "Nie ma dowodów, to nie nie prawda, to krzywdzące stereotypu a w ogóle to biali są be"
>Bieżąca wersja zestawu danych składa się z 24 000 próbek anonimizowanej treści, 12 000 sztuk dla „szkodliwych” i 12 000 dla klasy „neutralnej”.
A to dopiero pierwsza strona gorących