Notitieboek

GPU & inference

Serving, kernels, quantisatie en de kosten van het daadwerkelijk draaien van het model.

Wat hier thuishoort

GPU & inference is voor serving, kernels, quantisatie en de kosten van het daadwerkelijk draaien van een model. Notities hier gaan over hardware, latentie en geld — niet over prompts schrijven.

Titels, samenvattingen en deze definitie staan in de HTML. JavaScript opent alleen het mobiele menu.

Nog niets in dit onderdeel.

Deze index staat online, ook als hij leeg is, zodat het onderdeel een openbaar adres heeft. Nieuwe notities verschijnen hier als HTML, niet na JavaScript.