Como uso fine-tuning, cuantizacion y speculative decoding para acelerar un bot de voz
Por que un modelo 12B sin cuantizar no corre en una GPU de gaming, como QLoRA y cuantizacion de 4 bits lo hacen posible, y como un draft model ajustado lo hace 1.7x mas rapido, suficiente para una llamada en vivo.