Wie ich Fine-tuning, Quantisierung und Speculative Decoding nutze, um einen Voicebot zu beschleunigen
Warum ein nicht quantisiertes 12B-Modell auf einer Gaming-GPU nicht lauft, wie QLoRA und 4-Bit-Quantisierung es moglich machen, und wie ein feinabgestimmtes Draft-Modell es 1.7x schneller macht - schnell genug fur einen Live-Anruf.