Hejto.pl
Dodaj post

Wpisz coś do wyszukania (minimum 2 znaki)

Wpis użytkownika entropy_ w Hydepark

GURU

w Hydepark

203piorunów

DeepSeek – firma, która zrewolucjonizowała proces trenowania modeli AI, redukując koszty o ponad 95%, a jednocześnie osiągając wyniki porównywalne z najlepszymi modelami, takimi jak GPT-4 czy Claude.

Jak to zrobili? Przez całkowite przemyślenie dotychczasowych założeń i procesów.
Tradycyjne trenowanie modeli AI to koszmar pod względem kosztów. OpenAI czy Anthropic wydają ponad 100 milionów dolarów tylko na moc obliczeniową, wykorzystując ogromne centra danych z tysiącami drogich procesorów graficznych (GPU).
Tymczasem DeepSeek udowodnił, że można to zrobić za jedyne 5 milionów dolarów.

Kluczowe innowacje DeepSeek:
- Efektywne zarządzanie pamięcią:
   Tradycyjne modele AI przechowują dane na 32bitach, co wymaga ogromnych zasobów pamięci. DeepSeek zapytał: "Ale dlaczego 32? W zupełności wystarczy 8", pozwoliło to na zmniejszenie wymagań pamięci o 75%.
- System „multi-token”:
   Zamiast przetwarzać tekst słowo po słowie jak klasyczne LLM "Wróbel... siedział... na...", DeepSeek analizuje całe frazy na raz. To sprawia, że proces jest dwa razy szybszy przy zachowaniu 90% dokładności.
- System ekspertów (MoE - Mixture of Experts):
   Zamiast jednego ogromnego modelu uruchomionego CAŁY CZAS, DeepSeek wprowadził system wyspecjalizowanych modeli. Każdy z nich uruchamiany jest tylko wtedy, gdy jest potrzebny, co drastycznie zmniejsza ilość aktywnych parametrów (671 miliardów ale tylko 37 miliardów aktywnych na raz). Nie jest po pomysł nowy (używany wcześniej między innymi w modelach Mixtral) ale pierwszy raz zastosowany w tej skali

Rezultaty?
- Koszt trenowania spadł z 100 milionów do 5 milionów dolarów.
- Liczba potrzebnych GPU zmniejszyła się z 100 000 do 2 000.
- Koszty API są niższe o 95%.
- Modele mogą być uruchamiane na standardowych GPU dla graczy zamiast drogich GPU serwerowych.

Co ważne, DeepSeek postawił na otwartość. Kod i dokumentacja są publicznie dostępne, co otwiera drzwi dla mniejszych firm i indywidualnych innowatorów.

Dlaczego to ma znaczenie?
Demokratyzacja AI
   Dotychczas tylko najwięksi gracze z ogromnymi budżetami mogli trenować zaawansowane modele. Teraz proces ten staje się dostępny dla mniejszych podmiotów.

Zagrożenie dla dużych firm
Nvidia, dominujący dostawca GPU, może odczuć konsekwencje, gdyż ich model biznesowy opiera się na sprzedaży drogich procesorów z ogromną marżą.

Nowa fala innowacji
Mniejsze wymagania sprzętowe i finansowe oznaczają większą konkurencję, co może przyspieszyć rozwój całej branży.

Podsumowując, DeepSeek zadał pytanie: „Co, jeśli zamiast rzucać coraz więcej sprzętu, po prostu zoptymalizujemy proces?”
Odpowiedzią są przełomowe wyniki, spadek kursu NVIDIA na giełdzie i PANIKA w meta i OpenAI

Komentarze (76)

Fanatyk1piorunów

Ciekawa alternatywa, rozmawia sensownie, pisze kody, ma dostęp do info do 2023 ale może przeszukać net w poszukiwaniu info
Tylko trochę muli i nie zapamiętuje informacji
Będę na pewno dalej testować

Fanatyk1piorunów

@entropy_ nigdy nie jest tak że ma się cudowne dziecko. O wadach tu nic nie ma. Natomiast tak. Będzie dochodzić do optymalizacji kosztów.

Nie ma żadnej paniki. Bez przesady. Większość spółek na gieldzie jest przeszacownych i to mocno. Szczególnie aktualnie nvidia

Tytan2piorunów

Tylko taka uwaga - to jest "open source" ale bez "open zbiór danych na których uczyliśmy sieć". A to samo w sobie też może być swojego rodzaju sekretnym sosem

Osobistość3piorunów

Tylko pamiętajcie, żeby zapytać co sie działo na Placu Tiananmen w '89, na pewno Wam powie.

Kosmonauta2piorunów

Due to large-scale malicious attacks on DeepSeek's services, registration may be busy. Please wait and try again. Registered users can log in normally. Thank you for your understanding and support

Ciekawe kto ich tak atakuje :D
Albo to ściema, bo im serwery siadły.

Gruba ryba3piorunów

O Tajwan zapytajcie.

Lider3piorunów

c⁎⁎j im w d⁎⁎e 😒
[*] nvidia

Twórca2piorunów

jak to działa w praktyce? ktoś korzystał i ma porównanie z GPT? obsługuje też jeż polski?

Gruba ryba18piorunów

@entropy_ sankcje w postaci bana na chipy od nVidii wymusiły większą pomysłowość jak wykorzystać ograniczone zasoby.

Gwiazdor25piorunów

jakby zmniejszyli do 0 bitów to by zaoszczedzili 100%

Gruba ryba6piorunów

No i fajnie. Im szybciej AI zastąpi nas w pracy, tym szybciej rozwiąże się problem przeludnienia.

Autorytet0piorunów

@rakokuc @Chrabonszcz
Problem przeludnienia rozwiązuje się sam na naszych oczach. Nawet w Afryce czy Indiach, Bangladeszu współczynnik narodzin spada mocno.

Gruba ryba1piorunów

@rakokuc ok rozumiem dzieki Olisadebe I krzynowek to był duet, fakt

Gruba ryba3piorunów

@LaMo.zord o pracy dla (jakkolwiek dziwnie to nie brzmi) przyjemności też wspomniałem. I założyłem, że takiej pracy też nie będzie, bo po cholerę człowiek ma się wpieprzać maszynom, gdzie nawet jak robi za darmo, to trzeba go pilnować. Albo żeby niczego nie zepsuł, albo żeby sobie niczego nie zrobił - bo jednak ktoś będzie dalej za to odpowiadał.

A coś takiego jak dochód podstawowy nie będzie raczej wprowadzone (o ile w ogóle) po to, żeby wszyscy mieli raj i robili co im się podoba, tylko żeby się nie pozabijali. Także zarówno pod względem ekonomicznym jak i "rozrywkowym", brak pracy dla ludzi nie zapowiada się na życie w królestwie chrystusowym.

Może się mylę, może powinienem zacząć łykać Prozac, może pozwolą kiedyś Błaszczykowskiemu na powtórzenie tego pamiętnego karnego? Kto to wie.

Fanatyk7piorunów

Korzystam od tygodnia jakoś. Rewelacji nie widzę albo nie trafiłem na takiego case że pomoglo

Gruba ryba1piorunów

@RACO
> Korzystam od tygodnia jakoś. Rewelacji nie widzę albo nie trafiłem na takiego case że pomoglo

?

Fanatyk1piorunów

@FoxtrotLima mówiłem o gpt i to lokalnie.

Gruba ryba2piorunów

@RACO a co ma odpowiadać soft hostowany w Chinach? Odpal se lokalnie i będzie gadać.

Fanatyk1piorunów

@Chrabonszcz otwartych zapytan i brak cenzury w odpowiedzi. A nie że dostaje odpowiedź w stylu że nie może pomóc w tej sprawie. Ale jak wpisujesz w wyszukiwarkę to samo to odpowiedź na pierwszym miejscu.

Kosmonauta7piorunów

@RACO jakiej rewelacji spodziewasz się po modelu o 90% sprawności gpt4???

Rewelacja polega na niższych kosztach i open source.

Gruba ryba34piorunów

@entropy_ Łe, jestem rozczarowany-myślałem, że zredukowali koszty o 95% poprzez zwolnienie pracowników, a tu takie zaskoczenie.

Gruba ryba9piorunów

@sawa12721 tak by było, gdyby rzecz działa się w Polsce. xD optymalizacja kosztów przez oszczędzanie na pracownikach.

GURU32piorunów

@entropy_ ciekawy wpis. Z jednej strony fajnie, z innej jakoś tak średnio ufam Chińczykom, nawet w sferach open source.

Czyli obecnie mamy 90% normy z GPT4? Ciekawe jak tu wypada 1o, bo chyba ten odmienny model rozwoju nadal daje OpenAi bardziej "rozumne" Ai, choć kosztem niebotycznie wyższym.

GURU16piorunów

@Dziwen o1 i R1 od deepseek działają na zasadzie CoT (Chain of Thought), R1 przed udzieleniem odpowiedzi w tagach <think> </think> rozważa różne możliwości i dopiero udziela odpowiedzi na Twoje zapytanie.
O1 robi to samo ale OpenAi chowa przed użytkownikiem tą część odpowiedzi (żeby jak najdłużej zostać liderem na rynku nie pokazują jak ich model pracuje)

Fanatyk27piorunów

@entropy_ - a co mówiłem nie tak dawno o tym, że właśnie wchodzimy w fazę optymalizacjami kosztów AI bo te są zbyt duże by się AI w obecnej formie opłacało ciągnąć?

Mistrz6piorunów

@maly_ludek_lego poszperaj sobie

https://www.geopolitechs.org/p/deepseek-founder-becomes-a-guest
https://www.interconnects.ai/p/deepseek-v3-and-the-actual-cost-of
https://thezvi.substack.com/p/deekseek-v3-the-six-million-dollar
https://www.baiguan.news/p/deepseek-gpt4-llm-china-ai-innovation-chip-embargo-price-war-affordability-llama3-turbo-api-data-efficiency-agi-roadmap-multimodality-mathematics-natural-language-ecosystem-originality-economic-growth-talent-large-models
https://techcrunch.com/2025/01/20/deepseek-claims-its-reasoning-model-beats-openais-o1-on-certain-benchmarks/
https://analyticsindiamag.com/ai-news-updates/deepseek-crushes-openai-o1-with-an-mit-licensed-model-developers-are-losing-it/
https://www.geopolitechs.org/p/deepseek-launches-next-generation
https://docs.google.com/document/d/1x3FM01NDdXvvQTbkaJlPhyfBoBAFpE3E60tMe_ZlUH8/edit?pli=1&tab=t.0#heading=h.ve68kmdgtbo7
https://www.chinatalk.media/p/deepseek-ceo-interview-with-chinas
https://www.chinatalk.media/p/deepseeks-edge
https://www.ft.com/content/c99d86f0-2d17-49d0-8dc6-9662ed34c831
https://www.economist.com/leaders/2025/01/23/chinese-ai-is-catching-up-posing-a-dilemma-for-donald-trump
https://www.ft.com/content/747a7b11-dcba-4aa5-8d25-403f56216d7e

Część za paywallem, ale mam nadzieję, że ogarniesz temat 😉

DeepSeek Founder Becomes a Guest of China’s Premier, on the Same Day of the R1 Model LaunchAround noon on January 20, DeepSeek’s founder, Liang Wenfeng (梁文锋), had the company release the DeepSeek-R1 model, whose performance can match the official version of OpenAI’s o1.Geopolitechs
Fanatyk7piorunów

@entropy_ - wojna ekonomiczna trwa w najlepsze i wszystkie chwyty dozwolone by nikt nie zdobył za dużej przewagi 😆

Mistrz4piorunów

@entropy_ panie, ale to jest kilkanaście artykułów, często za paywallami - AI nie zabierze mi tej przyjemności xD

GURU0piorunów

@bojowonastawionaowca zrób jak ja z tym postem. Wruciłem dwa wątki z tt do deepseeka i kazałem podsumować po polsku xD
Poprawiłem kilka zdań bo za bardzo uprościł (polski język się i tak średnio nadaje do technicznej dyskusji na ten temat), dodałem tagi i gotowe xD

GURU24piorunów

@koszotorobur @bojowonastawionaowca według mnie nie tyle psują jakość co nie dopuszczają do objęcia totalnej dominacji.
Bardziej im się opłaca zrobić tornado w szalecie jak pozwolić żeby 90% opłaty za kibel trafało do usa.
Dali recptę wszystkim na takie obniżenie kosztów, że znam ludzi których stać to sfinansować samemu bez udziału nawet pożyczki z banku przy tych kosztach.
W meta i openai teraz to się wszyscy zesrali w gacie bo przy takiej redukcji kosztów orzenia i użytkowania ikt nie będzie ich potrzebował za 2 lata.

Mistrz7piorunów

@koszotorobur @entropy_ zresztą w ogóle miałem napisać coś więcej o DeepSeek, ale noż czasu nie mam, a tematów mnóstwo xD W każdym razie sporo źródełek się wysypało, mogę Wam coś podrzucić

Mistrz23piorunów

@koszotorobur @entropy_ taka delikatna ciekawostka — tego samego dnia, kiedy LLM Deepseeka ujrzał światło dzienne, to jego założyciel, pan Liang Wenfeng udał się na sympozjum premiera Li Qianga dotyczącym raportu z prac rządu i był tam jedynym przedstawicielem firm zajmujących się LLMami

Czy ciekawe czy nie, to już nie mi oceniać 😉

Fanatyk2piorunów

@entropy_ - w sensie wypuścili go by zepsuć amerykanom jakość?

GURU32piorunów

@koszotorobur @sawa12721 Ja nie wierzę w to, że Chińczycy tak z dobrego serca ten model wypuścili. Zrobili to (według mnie) żeby zdestabilizować rynek i nie pozwolić USA na dominację na tym polu.

Fanatyk5piorunów

@entropy_ - prędzej czy później fundusze oczekiwałyby zwrotu z inwestycji - nie da się pakować miliardów latami bo ludzie są niecierpliwi i łasi na kasę - ale wygląda na to, że chińczycy ten proces o kilka miesięcy przyśpieszyli.

GURU16piorunów

@bojowonastawionaowca a właśnie pytanie techniczne: W Chinach są "uczeni" jak na wschodzie czy "naukowcy" jak na zachodzie? xD

GURU33piorunów

@koszotorobur A mówiłeś, ale po prawdzie gdyby nie kińscy naukowcy to nikt by się nie wziął za obniżenie kosztów.
OpenAi i tak dostawał tyle kasy od inwestorów tyle ile chciał i nikomu absolutnie nie zależało na poprawie dopóki kasa płynie. Inwestorzy happy bo lider rynku, Nvidia happy bo zbyt, OpenAi happy bo wszyscy mogą tylko gonić ich ściśle tajną technologię.