
Wpis użytkownika entropy_ w Hydepark
entropy_GURU
203piorunówDeepSeek – firma, która zrewolucjonizowała proces trenowania modeli AI, redukując koszty o ponad 95%, a jednocześnie osiągając wyniki porównywalne z najlepszymi modelami, takimi jak GPT-4 czy Claude.
Jak to zrobili? Przez całkowite przemyślenie dotychczasowych założeń i procesów.
Tradycyjne trenowanie modeli AI to koszmar pod względem kosztów. OpenAI czy Anthropic wydają ponad 100 milionów dolarów tylko na moc obliczeniową, wykorzystując ogromne centra danych z tysiącami drogich procesorów graficznych (GPU).
Tymczasem DeepSeek udowodnił, że można to zrobić za jedyne 5 milionów dolarów.
Kluczowe innowacje DeepSeek:
- Efektywne zarządzanie pamięcią:
Tradycyjne modele AI przechowują dane na 32bitach, co wymaga ogromnych zasobów pamięci. DeepSeek zapytał: "Ale dlaczego 32? W zupełności wystarczy 8", pozwoliło to na zmniejszenie wymagań pamięci o 75%.
- System „multi-token”:
Zamiast przetwarzać tekst słowo po słowie jak klasyczne LLM "Wróbel... siedział... na...", DeepSeek analizuje całe frazy na raz. To sprawia, że proces jest dwa razy szybszy przy zachowaniu 90% dokładności.
- System ekspertów (MoE - Mixture of Experts):
Zamiast jednego ogromnego modelu uruchomionego CAŁY CZAS, DeepSeek wprowadził system wyspecjalizowanych modeli. Każdy z nich uruchamiany jest tylko wtedy, gdy jest potrzebny, co drastycznie zmniejsza ilość aktywnych parametrów (671 miliardów ale tylko 37 miliardów aktywnych na raz). Nie jest po pomysł nowy (używany wcześniej między innymi w modelach Mixtral) ale pierwszy raz zastosowany w tej skali
Rezultaty?
- Koszt trenowania spadł z 100 milionów do 5 milionów dolarów.
- Liczba potrzebnych GPU zmniejszyła się z 100 000 do 2 000.
- Koszty API są niższe o 95%.
- Modele mogą być uruchamiane na standardowych GPU dla graczy zamiast drogich GPU serwerowych.
Co ważne, DeepSeek postawił na otwartość. Kod i dokumentacja są publicznie dostępne, co otwiera drzwi dla mniejszych firm i indywidualnych innowatorów.
Dlaczego to ma znaczenie?
Demokratyzacja AI
Dotychczas tylko najwięksi gracze z ogromnymi budżetami mogli trenować zaawansowane modele. Teraz proces ten staje się dostępny dla mniejszych podmiotów.
Zagrożenie dla dużych firm
Nvidia, dominujący dostawca GPU, może odczuć konsekwencje, gdyż ich model biznesowy opiera się na sprzedaży drogich procesorów z ogromną marżą.
Nowa fala innowacji
Mniejsze wymagania sprzętowe i finansowe oznaczają większą konkurencję, co może przyspieszyć rozwój całej branży.
Podsumowując, DeepSeek zadał pytanie: „Co, jeśli zamiast rzucać coraz więcej sprzętu, po prostu zoptymalizujemy proces?”
Odpowiedzią są przełomowe wyniki, spadek kursu NVIDIA na giełdzie i PANIKA w meta i OpenAI
Komentarze (76)
Ciekawa alternatywa, rozmawia sensownie, pisze kody, ma dostęp do info do 2023 ale może przeszukać net w poszukiwaniu info
Tylko trochę muli i nie zapamiętuje informacji
Będę na pewno dalej testować
@entropy_ nigdy nie jest tak że ma się cudowne dziecko. O wadach tu nic nie ma. Natomiast tak. Będzie dochodzić do optymalizacji kosztów.
Nie ma żadnej paniki. Bez przesady. Większość spółek na gieldzie jest przeszacownych i to mocno. Szczególnie aktualnie nvidia
I ciekawostka z dziś - https://huggingface.co/blog/open-r1 już powstają bardziej "open" klony :smiley:
Tylko taka uwaga - to jest "open source" ale bez "open zbiór danych na których uczyliśmy sieć". A to samo w sobie też może być swojego rodzaju sekretnym sosem
Tylko pamiętajcie, żeby zapytać co sie działo na Placu Tiananmen w '89, na pewno Wam powie.
Due to large-scale malicious attacks on DeepSeek's services, registration may be busy. Please wait and try again. Registered users can log in normally. Thank you for your understanding and support
Ciekawe kto ich tak atakuje :D
Albo to ściema, bo im serwery siadły.
dlatego na giełdzie tak urwało
@entropy_ Czy to przypadkiem nie jest chiński produkt ?
O Tajwan zapytajcie.
c⁎⁎j im w d⁎⁎e 😒
[*] nvidia
jak to działa w praktyce? ktoś korzystał i ma porównanie z GPT? obsługuje też jeż polski?
@entropy_ sankcje w postaci bana na chipy od nVidii wymusiły większą pomysłowość jak wykorzystać ograniczone zasoby.
@rakokuc to tak nie działa 👀
jakby zmniejszyli do 0 bitów to by zaoszczedzili 100%
No i fajnie. Im szybciej AI zastąpi nas w pracy, tym szybciej rozwiąże się problem przeludnienia.
@rakokuc @Chrabonszcz
Problem przeludnienia rozwiązuje się sam na naszych oczach. Nawet w Afryce czy Indiach, Bangladeszu współczynnik narodzin spada mocno.
@rakokuc ok rozumiem dzieki Olisadebe I krzynowek to był duet, fakt
@LaMo.zord o pracy dla (jakkolwiek dziwnie to nie brzmi) przyjemności też wspomniałem. I założyłem, że takiej pracy też nie będzie, bo po cholerę człowiek ma się wpieprzać maszynom, gdzie nawet jak robi za darmo, to trzeba go pilnować. Albo żeby niczego nie zepsuł, albo żeby sobie niczego nie zrobił - bo jednak ktoś będzie dalej za to odpowiadał.
A coś takiego jak dochód podstawowy nie będzie raczej wprowadzone (o ile w ogóle) po to, żeby wszyscy mieli raj i robili co im się podoba, tylko żeby się nie pozabijali. Także zarówno pod względem ekonomicznym jak i "rozrywkowym", brak pracy dla ludzi nie zapowiada się na życie w królestwie chrystusowym.
Może się mylę, może powinienem zacząć łykać Prozac, może pozwolą kiedyś Błaszczykowskiemu na powtórzenie tego pamiętnego karnego? Kto to wie.
Korzystam od tygodnia jakoś. Rewelacji nie widzę albo nie trafiłem na takiego case że pomoglo
@FoxtrotLima mialme na mysli pana/pania RACO
@ostrynacienkim Mylisz mnie z pewnym marynarzem ( ͡° ͜ʖ ͡°)
@FoxtrotLima posiadacz akcji nvidii :grinning: ?
@RACO
> Korzystam od tygodnia jakoś. Rewelacji nie widzę albo nie trafiłem na takiego case że pomoglo
?
@FoxtrotLima mówiłem o gpt i to lokalnie.
@RACO a co ma odpowiadać soft hostowany w Chinach? Odpal se lokalnie i będzie gadać.
@Chrabonszcz otwartych zapytan i brak cenzury w odpowiedzi. A nie że dostaje odpowiedź w stylu że nie może pomóc w tej sprawie. Ale jak wpisujesz w wyszukiwarkę to samo to odpowiedź na pierwszym miejscu.
@RACO jakiej rewelacji spodziewasz się po modelu o 90% sprawności gpt4???
Rewelacja polega na niższych kosztach i open source.
@entropy_ Łe, jestem rozczarowany-myślałem, że zredukowali koszty o 95% poprzez zwolnienie pracowników, a tu takie zaskoczenie.
@sawa12721 tak by było, gdyby rzecz działa się w Polsce. xD optymalizacja kosztów przez oszczędzanie na pracownikach.
@entropy_ ciekawy wpis. Z jednej strony fajnie, z innej jakoś tak średnio ufam Chińczykom, nawet w sferach open source.
Czyli obecnie mamy 90% normy z GPT4? Ciekawe jak tu wypada 1o, bo chyba ten odmienny model rozwoju nadal daje OpenAi bardziej "rozumne" Ai, choć kosztem niebotycznie wyższym.
@Dziwen o1 i R1 od deepseek działają na zasadzie CoT (Chain of Thought), R1 przed udzieleniem odpowiedzi w tagach <think> </think> rozważa różne możliwości i dopiero udziela odpowiedzi na Twoje zapytanie.
O1 robi to samo ale OpenAi chowa przed użytkownikiem tą część odpowiedzi (żeby jak najdłużej zostać liderem na rynku nie pokazują jak ich model pracuje)
@entropy_ - a co mówiłem nie tak dawno o tym, że właśnie wchodzimy w fazę optymalizacjami kosztów AI bo te są zbyt duże by się AI w obecnej formie opłacało ciągnąć?
@bojowonastawionaowca dzięki wielkie! :smiley:
@maly_ludek_lego poszperaj sobie
https://www.geopolitechs.org/p/deepseek-founder-becomes-a-guest
https://www.interconnects.ai/p/deepseek-v3-and-the-actual-cost-of
https://thezvi.substack.com/p/deekseek-v3-the-six-million-dollar
https://www.baiguan.news/p/deepseek-gpt4-llm-china-ai-innovation-chip-embargo-price-war-affordability-llama3-turbo-api-data-efficiency-agi-roadmap-multimodality-mathematics-natural-language-ecosystem-originality-economic-growth-talent-large-models
https://techcrunch.com/2025/01/20/deepseek-claims-its-reasoning-model-beats-openais-o1-on-certain-benchmarks/
https://analyticsindiamag.com/ai-news-updates/deepseek-crushes-openai-o1-with-an-mit-licensed-model-developers-are-losing-it/
https://www.geopolitechs.org/p/deepseek-launches-next-generation
https://docs.google.com/document/d/1x3FM01NDdXvvQTbkaJlPhyfBoBAFpE3E60tMe_ZlUH8/edit?pli=1&tab=t.0#heading=h.ve68kmdgtbo7
https://www.chinatalk.media/p/deepseek-ceo-interview-with-chinas
https://www.chinatalk.media/p/deepseeks-edge
https://www.ft.com/content/c99d86f0-2d17-49d0-8dc6-9662ed34c831
https://www.economist.com/leaders/2025/01/23/chinese-ai-is-catching-up-posing-a-dilemma-for-donald-trump
https://www.ft.com/content/747a7b11-dcba-4aa5-8d25-403f56216d7e
Część za paywallem, ale mam nadzieję, że ogarniesz temat 😉
DeepSeek Founder Becomes a Guest of China’s Premier, on the Same Day of the R1 Model LaunchAround noon on January 20, DeepSeek’s founder, Liang Wenfeng (梁文锋), had the company release the DeepSeek-R1 model, whose performance can match the official version of OpenAI’s o1.Geopolitechs@bojowonastawionaowca mogą być same źródła.
@entropy_ - wojna ekonomiczna trwa w najlepsze i wszystkie chwyty dozwolone by nikt nie zdobył za dużej przewagi 😆
@maly_ludek_lego same źródła czy teksty? 😛
@entropy_ panie, ale to jest kilkanaście artykułów, często za paywallami - AI nie zabierze mi tej przyjemności xD
@bojowonastawionaowca zrób jak ja z tym postem. Wruciłem dwa wątki z tt do deepseeka i kazałem podsumować po polsku xD
Poprawiłem kilka zdań bo za bardzo uprościł (polski język się i tak średnio nadaje do technicznej dyskusji na ten temat), dodałem tagi i gotowe xD
@bojowonastawionaowca @bojowonastawionaowca dawaj owca. Poczytam.
@koszotorobur @bojowonastawionaowca według mnie nie tyle psują jakość co nie dopuszczają do objęcia totalnej dominacji.
Bardziej im się opłaca zrobić tornado w szalecie jak pozwolić żeby 90% opłaty za kibel trafało do usa.
Dali recptę wszystkim na takie obniżenie kosztów, że znam ludzi których stać to sfinansować samemu bez udziału nawet pożyczki z banku przy tych kosztach.
W meta i openai teraz to się wszyscy zesrali w gacie bo przy takiej redukcji kosztów orzenia i użytkowania ikt nie będzie ich potrzebował za 2 lata.
@koszotorobur @entropy_ zresztą w ogóle miałem napisać coś więcej o DeepSeek, ale noż czasu nie mam, a tematów mnóstwo xD W każdym razie sporo źródełek się wysypało, mogę Wam coś podrzucić
@bojowonastawionaowca - tam nic nie dzieje się bez przyczyny :face_with_raised_eyebrow:
@koszotorobur @entropy_ taka delikatna ciekawostka — tego samego dnia, kiedy LLM Deepseeka ujrzał światło dzienne, to jego założyciel, pan Liang Wenfeng udał się na sympozjum premiera Li Qianga dotyczącym raportu z prac rządu i był tam jedynym przedstawicielem firm zajmujących się LLMami
Czy ciekawe czy nie, to już nie mi oceniać 😉
@entropy_ - w sensie wypuścili go by zepsuć amerykanom jakość?
@entropy_ w Chinach są towarzysze drogi kolego 😛
@koszotorobur @sawa12721 Ja nie wierzę w to, że Chińczycy tak z dobrego serca ten model wypuścili. Zrobili to (według mnie) żeby zdestabilizować rynek i nie pozwolić USA na dominację na tym polu.
@entropy_ - prędzej czy później fundusze oczekiwałyby zwrotu z inwestycji - nie da się pakować miliardów latami bo ludzie są niecierpliwi i łasi na kasę - ale wygląda na to, że chińczycy ten proces o kilka miesięcy przyśpieszyli.
@bojowonastawionaowca a właśnie pytanie techniczne: W Chinach są "uczeni" jak na wschodzie czy "naukowcy" jak na zachodzie? xD
@koszotorobur A mówiłeś, ale po prawdzie gdyby nie kińscy naukowcy to nikt by się nie wziął za obniżenie kosztów.
OpenAi i tak dostawał tyle kasy od inwestorów tyle ile chciał i nikomu absolutnie nie zależało na poprawie dopóki kasa płynie. Inwestorzy happy bo lider rynku, Nvidia happy bo zbyt, OpenAi happy bo wszyscy mogą tylko gonić ich ściśle tajną technologię.