Projekt własny: oprogramowanie, które sami zbudowaliśmy i utrzymujemy.
TinyServe
Prawdziwy model językowy liczy odpowiedzi na żywo w Twojej przeglądarce, przez WebGPU. Na ekranie widzisz, jak rośnie pamięć rozmowy (siatka KV cache), na które słowa model patrzy (mapy uwagi) i jak mały model podpowiada dużemu (spekulacyjne dekodowanie). To, co normalnie dzieje się w ukryciu na serwerze, tu oglądasz na własne oczy.

LLM to czarna skrzynka, nawet dla inżynierów
Zespoły wdrażające AI często pytają: czemu długi prompt liczy się szybko, a odpowiedź powstaje wolno? Czemu pamięć karty graficznej kończy się przy dłuższej rozmowie? Slajdy i diagramy z artykułów tego nie tłumaczą. TinyServe pokazuje te mechanizmy na żywo, na prawdziwym modelu, bez serwera i bez instalacji.
Cztery mechanizmy inferencji, widoczne na żywo
Dwie fazy inferencji renderowane osobno: dlaczego długi prompt liczy się szybko (prefill, równolegle), a generowanie tekstu jest wolniejsze (decode, token po tokenie).
Trójwymiarowa siatka (warstwy × głowice × pozycje) wypełniająca się na żywo w miarę generowania kolejnych tokenów: widać dokładnie, ile pamięci GPU zużywa dłuższa rozmowa.
Cieplna mapa uwagi per warstwa i głowica: które wcześniejsze tokeny model faktycznie bierze pod uwagę, generując następny.
Mały model proponuje token, duży go przyjmuje albo odrzuca (przyspieszenie bez utraty jakości); osobno symulacja alokatora bloków pamięci (jak w vLLM) kontra alokacja ciągła, z wizualizacją zapchania pamięci.
Prawdziwy model, nie animacja na pokaz
modeli przełączasz na żywo (Qwen3 0.6B i 1.7B, Llama 3.2, LFM2.5 1.2B, DeepSeek-R1) i porównujesz ich zachowanie na własne oczy.
waży najmniejszy z modeli (Qwen3 0.6B): uruchamiasz prawdziwy model językowy w przeglądarce bez długiego czekania.
zapytań do serwera podczas generowania: wszystko liczy się na Twoim komputerze, więc nic nie wycieka na zewnątrz.
Każdy wybór ma powód
Masz uciążliwy problem? Opisz go, resztę zakoduję.
Jedno zdanie wystarczy, żeby zacząć. Napisz, co Cię uwiera. Wracam w 48 godzin z odpowiedzią, czy da się to zrobić, i ze stałą ceną.