AI

TinyServe: jak myśli model językowy, na żywo

TinyServe pokazuje na ekranie, co model językowy robi między pytaniem a odpowiedzią, i liczy tę odpowiedź na Twoim komputerze.

TinyServe: wykres opóźnienia na token i odczyty prefill kontra dekodowanie, na żywo w przeglądarce
Ekran, który zobaczysz po otwarciu: kafelki z widokami, od prefill i dekodowania po mapy uwagi i losowanie tokenu.
Wyzwanie

LLM to czarna skrzynka, nawet dla inżynierów

Zespoły wdrażające AI często pytają: czemu długi prompt liczy się szybko, a odpowiedź powstaje wolno? Czemu pamięć karty graficznej kończy się przy dłuższej rozmowie? Slajdy i diagramy z artykułów tego nie tłumaczą. TinyServe pokazuje te mechanizmy na żywo, na prawdziwym modelu, bez serwera i bez instalacji.

Jak to działa

Pięć mechanizmów inferencji, widocznych na żywo

Prefill i decode
Dwie fazy inferencji renderowane osobno: dlaczego długi prompt liczy się szybko (prefill, równolegle), a generowanie tekstu jest wolniejsze (decode, token po tokenie).
KV cache
Wykres pamięci rosnącej z każdym tokenem, na tle budżetu, jaki daje okno kontekstu: widać dokładnie, ile pamięci GPU zużywa dłuższa rozmowa.
Mapy uwagi
Cieplna mapa uwagi per warstwa i głowica: które wcześniejsze tokeny model faktycznie bierze pod uwagę, generując następny.
Spekulacyjne dekodowanie i pamięć stronicowana
Mały model proponuje token, duży go przyjmuje albo odrzuca (przyspieszenie bez utraty jakości); osobno symulacja alokatora bloków pamięci (jak w vLLM) kontra alokacja ciągła, z wizualizacją zapchania pamięci.
Losowanie następnego tokenu
Pełna karta ocen jednego kroku: prawdopodobieństwa, z których model wybierał następny token, i co robi z nimi temperatura.
Liczby

Prawdziwy model, nie animacja na pokaz

Rozmowa nie opuszcza Twojego komputera.

5
modeli przełączasz na żywo (Qwen3 0.6B i 1.7B, Llama 3.2, LFM2.5 1.2B, DeepSeek-R1) i porównujesz ich zachowanie na własne oczy.
552 MB
waży najmniejszy z modeli (Qwen3 0.6B): rozmiar mierzony z repozytorium przed pobraniem, nie szacowany. Druga wizyta startuje z cache przeglądarki.
0
zapytań do serwera podczas generowania: wszystko liczy się na Twoim komputerze, więc nic nie wycieka na zewnątrz.

Narzędzie dla programistów i inżynierów ML. Projekt własny. Zbudowaliśmy go i utrzymujemy sami. Model pobiera się raz, a potem liczy u Ciebie.

Sprawdź te liczby w demo

Stack

Każdy wybór ma powód

WarstwaWybórCo to daje
JęzykTypeScript, bez frameworkaStrona zostaje lekka, więc wykresy nadążają za generowaniem tekstu.
BuildViteCałość jest statycznym plikiem: otwierasz adres i działa, bez serwera po drugiej stronie.
Inferencja@huggingface/​transformers (WebGPU)Odpowiedzi liczy prawdziwy model na Twojej karcie graficznej, a nie nagranie z serwera.
WizualizacjeD3Pamięć, opóźnienia i uwagę modelu widzisz jako rysunek zmieniający się z każdym tokenem.
Kontakt

Opisz problem, wracamy z ceną

Jedno zdanie wystarczy na start. Czytamy je my, nie formularz zgłoszeniowy, i odpowiadamy, czy da się to zrobić i za ile.

  • Odpowiadamy w ciągu 48 godzin w dni robocze.
  • Audyt wstępny nic nie kosztuje, a raport zostaje u Ciebie niezależnie od decyzji.
  • Stała cena albo nie zaczynamy. Jeśli praca zajmie nam więcej, dopłaty nie ma.
  • Bierzemy dwa projekty naraz. Przy pilnym terminie odezwij się wcześniej.

Albo napisz wprost na adres contact@tenzanlogic.com

Trzy pytania, żeby wycena była trafna. Opcjonalne.
Czego dotyczy problem
Co macie dzisiaj
Horyzont

Dane z formularza służą wyłącznie odpowiedzi na Twoje zapytanie. Szczegóły w polityce prywatności.