01Case study · AI

Projekt własny: oprogramowanie, które sami zbudowaliśmy i utrzymujemy.

TinyServe

Prawdziwy model językowy liczy odpowiedzi na żywo w Twojej przeglądarce, przez WebGPU. Na ekranie widzisz, jak rośnie pamięć rozmowy (siatka KV cache), na które słowa model patrzy (mapy uwagi) i jak mały model podpowiada dużemu (spekulacyjne dekodowanie). To, co normalnie dzieje się w ukryciu na serwerze, tu oglądasz na własne oczy.

Otwórz demo na żywoZamów bezpłatny audyt
TinyServe: siatka KV cache i wizualizacja działania modelu językowego na żywo w przeglądarceDemo na żywo
02Wyzwanie

LLM to czarna skrzynka, nawet dla inżynierów

Zespoły wdrażające AI często pytają: czemu długi prompt liczy się szybko, a odpowiedź powstaje wolno? Czemu pamięć karty graficznej kończy się przy dłuższej rozmowie? Slajdy i diagramy z artykułów tego nie tłumaczą. TinyServe pokazuje te mechanizmy na żywo, na prawdziwym modelu, bez serwera i bez instalacji.

03Jak to działa

Cztery mechanizmy inferencji, widoczne na żywo

Prefill vs decode

Dwie fazy inferencji renderowane osobno: dlaczego długi prompt liczy się szybko (prefill, równolegle), a generowanie tekstu jest wolniejsze (decode, token po tokenie).

Siatka KV cache

Trójwymiarowa siatka (warstwy × głowice × pozycje) wypełniająca się na żywo w miarę generowania kolejnych tokenów: widać dokładnie, ile pamięci GPU zużywa dłuższa rozmowa.

Mapy uwagi

Cieplna mapa uwagi per warstwa i głowica: które wcześniejsze tokeny model faktycznie bierze pod uwagę, generując następny.

Spekulacyjne dekodowanie i pamięć stronicowana

Mały model proponuje token, duży go przyjmuje albo odrzuca (przyspieszenie bez utraty jakości); osobno symulacja alokatora bloków pamięci (jak w vLLM) kontra alokacja ciągła, z wizualizacją zapchania pamięci.

04Liczby

Prawdziwy model, nie animacja na pokaz

5

modeli przełączasz na żywo (Qwen3 0.6B i 1.7B, Llama 3.2, LFM2.5 1.2B, DeepSeek-R1) i porównujesz ich zachowanie na własne oczy.

570 MB

waży najmniejszy z modeli (Qwen3 0.6B): uruchamiasz prawdziwy model językowy w przeglądarce bez długiego czekania.

0

zapytań do serwera podczas generowania: wszystko liczy się na Twoim komputerze, więc nic nie wycieka na zewnątrz.

Sprawdź te liczby sam w demo
05Stack

Każdy wybór ma powód

Język
TypeScript, bez frameworka
Vanilla DOM + canvas/WebGL, zero biblioteki komponentów
Build
Vite 8
Szybki dev server, statyczny build produkcyjny
Inferencja
@huggingface/​transformers (WebGPU)
Prawdziwy model językowy liczony na GPU w przeglądarce, WASM jako fallback
Wizualizacje
three.js + D3
Siatka 3D KV cache, mapy uwagi, wykresy pamięci i przepustowości
06Kontakt

Masz uciążliwy problem? Opisz go, resztę zakoduję.

Jedno zdanie wystarczy, żeby zacząć. Napisz, co Cię uwiera. Wracam w 48 godzin z odpowiedzią, czy da się to zrobić, i ze stałą ceną.

Bez zobowiązań: opisanie problemu nic nie kosztuje
Bezpłatny audyt na start: raport zostaje u Ciebie
Stała cena ustalona z góry albo nie zaczynamy: bez niespodzianek na fakturze
Ograniczona liczba projektów naraz, każdy z pełną uwagą: przy pilnym terminie odezwij się wcześniej
Odpowiadamy w ciągu 48 godzin
Napisz bezpośrednio
contact@tenzanlogic.com