Menedżer zadań pokazuje Dedykowana pamięć GPU 7,8/8,0 GB oraz Współdzielona pamięć GPU 0,6/15,9 GB. Czy karta ma więc dostępne 23,9 GB? Czy 8 GB już się skończyło? Czy model z siedmioma miliardami parametrów zmieści się tylko dlatego, że ktoś podpisał go jako „4-bit”?
Te pytania mieszają cztery różne rzeczy: fizyczną pojemność, pamięć przydzieloną przez program, budżet, który Windows pozwala obecnie utrzymać jako rezydentny, oraz zestaw roboczy potrzebny bez przenoszenia danych gdzie indziej. Czasem mają podobne wartości. Nie są zamienne.
Użyteczna odpowiedź nie brzmi „teraz każdy potrzebuje 12 GB”. Brzmi tak: wybierz tyle pamięci dedykowanej, aby rzeczywisty szczyt zestawu roboczego mieścił się w budżecie systemu, z zapasem na tymczasowe przydziały i inne otwarte programy. Gry i lokalne AI budują ten zestaw inaczej, dlatego będziemy je mierzyć inaczej.
Pamięć dedykowana, współdzielona, użycie i budżet
| Liczba | Co oznacza | Czego nie oznacza |
|---|---|---|
| Dedykowana pamięć GPU | Lokalna pamięć karty dedykowanej albo segment zgłaszany przez sterownik jako dedykowany | Nie cała musi być gwarantowana jednej grze w każdej chwili |
| Współdzielona pamięć GPU | Maksymalna część RAM, którą Windows może udostępnić karcie | Nie jest zajęta w całości z góry i nie jest odpowiednikiem lokalnego VRAM |
| Bieżące użycie | Pamięć przypisana procesowi lub karcie przez dany sposób raportowania | Nie oddziela samo w sobie niezbędnych danych od cache do ponownego użycia |
| Budżet pamięci wideo | Ilość, którą według Windows program powinien utrzymywać jako rezydentną | Nie jest stała na zawsze i może zmieniać się przez inne programy |
Microsoft definiuje SharedSystemMemory w DXGI jako maksymalną ilość pamięci systemowej, którą karta może zużyć podczas pracy. Najważniejsze słowo to „maksymalną”. Wartość 15,9 GB nie oznacza, że Windows zabrał tyle ze zwykłego RAM, i nie zmienia karty 8 GB w kartę 23,9 GB.
W dedykowanym GPU lokalny VRAM ma bezpośrednią ścieżkę i przepustowość, wokół których zaprojektowano kartę. Dane umieszczone w RAM przechodzą inną drogą. W zintegrowanym GPU pamięć współdzielona jest normalna, bo CPU i GPU korzystają z tej samej fizycznej puli. Nie porównuj opisów iGPU z kartą dedykowaną tak, jakby architektura była identyczna.
Dlaczego pełny pasek VRAM nie jest diagnozą
Programy mają dobry powód, aby używać wolnej pamięci jako cache. Pusty pasek VRAM nie jest celem wydajnościowym. Jeśli gra może zachować teksturę zamiast ponownie ją wczytywać, za niewykorzystaną pamięć nie dostanie nagrody.
Mocniejszym sygnałem jest presja na granicy budżetu. Struktura
DXGI_QUERY_VIDEO_MEMORY_INFO Microsoftu pokazuje CurrentUsage i Budget. Dokumentacja
ostrzega, że przekroczenie budżetu może powodować przycięcia lub inne kary wydajnościowe, gdy Windows
robi miejsce dla pozostałych programów. Dokumentacja DXGI 1.4 dodaje, że budżet może się wyraźnie
zmieniać, gdy procesy w tle budzą się, zasypiają albo użytkownik przełącza aplikacje.
Jak gry zużywają pamięć GPU
Gra używa pamięci GPU nie tylko na pliki tekstur. Zestaw roboczy może zawierać poziomy mip tekstur, modele, cele renderowania, bufory głębi i cieni, struktury akcelerujące, dane shaderów i potoku, historię klatek oraz zasoby tymczasowe. Rozdzielczość i wewnętrzna skala wpływają na cele renderowania. Jakość tekstur zmienia poziomy mip, które silnik chce utrzymać. Ray tracing i część technik rekonstrukcji dodają własne zasoby. Dokładny zestaw zmienia się między silnikami, a nawet scenami.
Dokumentacja streamingu tekstur Unreal Engine pokazuje ten budżet wprost. Silnik utrzymuje pulę, wylicza potrzebną rozdzielczość każdej tekstury, wczytuje lub usuwa poziomy mip i może ograniczyć pulę do dostępnego VRAM. Dlatego gra działa dobrze w jednym pokoju, a zacina się przy obrocie kamery na dużym terenie. Zmienił się szczyt zestawu roboczego.
Test w grze, który naprawdę coś mówi
- Wybierz najcięższą powtarzalną trasę, w którą faktycznie grasz, nie pusty samouczek.
- Uruchom ją dwa razy. Zły pierwszy przebieg i czysty drugi sugerują cache lub kompilację.
- Zapisuj pamięć dedykowaną, współdzieloną, czas klatek, użycie GPU oraz RAM podczas całej trasy.
- Obniż wyłącznie jakość tekstur o jeden poziom i powtórz test.
- Jeśli znika jednocześnie przekroczenie budżetu i przycięcie, presja VRAM staje się wiarygodną przyczyną. Jeśli zmienia się tylko średni FPS, prawdopodobnie nie był to limit pamięci.
Poradnik o wysokim FPS i przycięciach pokazuje, jak rozdzielić streaming pamięci od kompilacji shaderów i limitu CPU.
Jak lokalne AI zużywa VRAM
Lokalna inferencja zaczyna się od bardziej przewidywalnego minimum: wag modelu. Przybliżony rozmiar samych wag policzysz tak:
liczba parametrów × bity na wagę ÷ 8
Siedem miliardów parametrów przy 16 bitach to około 14 GB surowych wag. Przy 4 bitach około 3,5 GB. Żadna z tych liczb nie jest pełnym wymaganiem podczas pracy. Format kwantyzowany potrzebuje skal i metadanych, backend buforów, a generowanie tekstu korzysta z pamięci kluczy i wartości, czyli KV cache. Generowanie obrazu dodaje własne części modelu, aktywacje i tensory tymczasowe.
Długość kontekstu ma znaczenie, ponieważ KV cache rośnie wraz z tokenami zachowywanymi dla mechanizmu uwagi. Liczy się też wielkość partii i liczba równoległych żądań. Dokumentacja Hugging Face opisuje przenoszenie cache do CPU oraz jego kwantyzację jako sposoby ograniczenia pamięci, ale z kosztem szybkości lub opóźnienia. To uczciwy model: „mieści się” i „działa dobrze” są różnymi celami.
| Składnik pamięci AI | Co go powiększa | Typowy sposób zmniejszenia |
|---|---|---|
| Wagi | Liczba parametrów i precyzja | Niższa kwantyzacja albo częściowe przeniesienie do CPU |
| KV cache | Długość kontekstu, partia i architektura | Krótszy kontekst, kwantyzacja cache albo offload |
| Bufory wykonawcze | Backend, kernele i obciążenie | Ustawienia backendu oszczędzające pamięć |
| Inne modele i programy | Równoległe sesje i pulpit używający GPU | Zamknięcie ich albo jawny zapas |
Co zmienia 8, 12, 16 i 24 GB
To zakresy obciążeń, nie daty ważności. Dobrze zbudowana gra przy rozsądnych ustawieniach może przez lata mieścić się w mniejszym zakresie. Jeden przesadzony preset tekstur albo większy model AI może jutro przekroczyć większy.
| Pojemność | Rozsądne oczekiwanie | Główny spodziewany kompromis |
|---|---|---|
| 8 GB | Gry e-sportowe i wiele gier w 1080p lub po zmianie tekstur; małe modele kwantyzowane albo częściowy offload do GPU | Mniejszy zapas na tekstury wysokiej rozdzielczości, wiele otwartych programów i dłuższy kontekst AI |
| 12 GB | Swobodniejszy budżet tekstur w 1440p i szerszy zestaw modeli kwantyzowanych utrzymanych na GPU | Nadal łatwo przekroczyć go dużym modelem, wysoką rozdzielczością z ciężkim RT lub kilkoma zadaniami GPU |
| 16 GB | Praktyczny cel mieszany dla wymagających gier, tworzenia treści i eksperymentów z lokalnym AI | Nie gwarantuje działania dużych modeli ani każdego presetu ultra |
| 24 GB+ | Większe modele lokalne, dłuższy kontekst, praca w wysokiej rozdzielczości i mniej kompromisów z offloadem | Pojemność nie zastępuje mocy GPU, przepustowości, RAM ani odpowiedniego zasilacza |
Jeśli jedynym zadaniem są gry, nie kupuj samej pojemności. Wolniejsze GPU z większym VRAM nadal może nie osiągnąć docelowego FPS. Jeśli lokalne AI jest prawdziwym obciążeniem, pojemność może zdecydować, czy model w ogóle pozostanie na GPU. Zapisz, która strona jest ważniejsza, zanim porównasz karty.
Test, który warto wykonać przed zakupem
- Zdefiniuj obciążenie. Nazwij gry, rozdzielczość, jakość tekstur, model, kwantyzację, kontekst i programy pozostające otwarte.
- Zmierz prawdziwy szczyt. Użyj ciężkiej powtarzalnej sceny albo najdłuższego promptu i partii, których planujesz używać. Ekran tytułowy i jedno zdanie nie są szczytem.
- Oddziel użycie od presji. Zapisz objaw, pamięć dedykowaną, współdzieloną oraz budżet Windows, jeśli narzędzie go pokazuje.
- Przetestuj dźwignię związaną z pamięcią. W grze obniż tekstury. W AI skróć kontekst albo zmniejsz format kwantyzacji. Nie zmieniaj pięciu niezwiązanych opcji.
- Dodaj zapas. Zostaw miejsce na zmianę sceny, bufory tymczasowe, przeglądarkę, nagrywanie i zmienny budżet systemu.
- Porównuj całą kartę. Wydajność, przepustowość pamięci, pojemność VRAM, moc, chłodzenie, cena i stos programowy mają znaczenie.
Co PC Workman potrafi powiedzieć dzisiaj
Przy obsługiwanej telemetrii NVIDIA PC Workman odczytuje bieżące użycie i procent dedykowanego VRAM
przez nvidia-smi, zapisuje procent obok obciążenia, temperatury i mocy GPU, a hck_GPT
potrafi odpowiedzieć na pytanie o aktualne użycie VRAM. Widok na żywo pokazuje również taktowania.
Skan sprzętu zapisuje zgłaszaną pojemność karty.
Obecna wersja nie pokazuje budżetu pamięci Windows dla każdego procesu, rezydentności pamięci współdzielonej, liczby usunięć zasobów ani kalkulatora pamięci modelu AI. Do tych wartości użyj Menedżera zadań i narzędzi obciążenia. Użyteczną rolą PC Workmana jest zachowanie trendu pamięci dedykowanej obok obciążenia, temperatury, taktowań i mocy GPU, bez udawania, że jeden procent dowodzi przyczyny.
Krótkie odpowiedzi
Czy pamięć współdzielona GPU jest tym samym co VRAM?
Nie. Przy karcie dedykowanej jest to RAM, który Windows może udostępnić karcie. Nie jest z góry zajęty w całości i nie działa jak taka sama ilość lokalnego VRAM.
Czy 100% użycia VRAM oznacza, że potrzebuję nowej karty?
Nie samo w sobie. Szukaj powtarzalnego objawu w chwili przekroczenia budżetu, zwłaszcza skoków czasu klatki, wzrostu pamięci współdzielonej, obniżenia jakości albo błędu braku pamięci.
Ile VRAM potrzebuje lokalny model AI?
Zacznij od liczby parametrów pomnożonej przez bity na wagę i podzielonej przez osiem. Dodaj metadane kwantyzacji, bufory wykonawcze i KV cache. Kontekst i offload mogą mocno zmienić wynik.
Źródła pierwotne
- Microsoft DXGI: definicje pamięci karty.
- Microsoft: użycie, budżet i presja pamięci wideo.
- Microsoft DXGI 1.4: zmienny budżet pamięci.
- Unreal Engine: streaming i pula tekstur.
- Hugging Face Transformers: KV cache, kwantyzacja i offload.
- Hugging Face Transformers: przegląd optymalizacji.
Pełny pasek pamięci to dopiero jedna wskazówka. Przejrzyj wszystkie poradniki PC Workmana →