Tencent abre AngelSpec: framework para decodificación especulativa

⏱ Tiempo de lectura: 4 min
Tencent ha publicado AngelSpec, un framework de código abierto basado en PyTorch para entrenar modelos de decodificación especulativa en seis arquitecturas diferentes. La herramienta introduce DFly, un drafter con difusión de bloques y acondicionamiento híbrido, e integra D-cut para asignación de presupuesto de verificación adaptativa en tiempo de ejecución. En pruebas con HY3-295B-A21B, DFly-8 logró acelerar entre 1,98× y 2,40× respecto a decodificación autorregresiva en concurrencias de 4 a 64.
Qué es AngelSpec y cómo funciona
AngelSpec es un framework unificado que combina entrenamiento para Tensor Parallelism (MTP) y decodificación especulativa con paralelismo de bloques. Su componente central, DFly (Block-Diffusion Flyer), utiliza una cabeza autorregresiva correctora oculta y acondicionamiento híbrido del objetivo para mejorar la precisión del drafting. La integración de D-cut permite adaptar dinámicamente cuántos tokens verificar según la carga de trabajo, optimizando el balance entre velocidad y consumo computacional en modelos de lenguaje grandes.
Rendimiento y especificaciones técnicas
En el modelo HY3-295B-A21B con Tensor Parallelism (TP) configurado en 8, DFly-8 demostró ganancias de velocidad de 1,98× a 2,40× comparado con decodificación autorregresiva estándar. Estos resultados abarcan concurrencias que van desde 4 hasta 64 solicitudes simultáneas. El framework soporta seis arquitecturas diferentes y está diseñado como una herramienta de código abierto compatible con el ecosistema PyTorch, facilitando su integración en pipelines de entrenamiento e inferencia existentes. D-cut permite ajustar el presupuesto de tokens a verificar en función de patrones de carga observados en tiempo real.
| Elemento | Detalle |
|---|---|
| Nombre | AngelSpec |
| Tipo | Framework de código abierto para decodificación especulativa |
| Base | PyTorch nativo |
| Arquitecturas soportadas | Seis arquitecturas diferentes |
| Componente principal | DFly (Block-Diffusion Flyer con acondicionamiento híbrido) |
| Optimización de presupuesto | D-cut (asignación adaptativa en runtime) |
| Modelo de prueba | HY3-295B-A21B con TP=8 |
| Speedup medido | 1,98–2,40× vs. decodificación autorregresiva |
| Rango de concurrencia evaluado | 4 a 64 solicitudes simultáneas |
Por qué es relevante
La decodificación especulativa es una técnica clave para acelerar modelos de lenguaje sin comprometer calidad. AngelSpec estandariza y optimiza esta aproximación en código abierto, permitiendo a investigadores e ingenieros integrar estas técnicas en sus flujos de trabajo. Las mejoras de velocidad medidas son significativas para aplicaciones que requieren baja latencia, desde chat hasta procesamiento en lote de alta concurrencia.
Preguntas frecuentes
¿Qué diferencia a DFly de otros drafters especulativos?
DFly utiliza difusión de bloques con acondicionamiento híbrido del objetivo y una cabeza autorregresiva correctora oculta. Esta combinación mejora la capacidad de predicción del drafter sin aumentar significativamente el costo computacional durante el entrenamiento e inferencia.
¿En qué modelos puedo usar AngelSpec?
El framework soporta seis arquitecturas diferentes, aunque la fuente no especifica cuáles son. El ejemplo más documentado es HY3-295B-A21B, modelo de Tencent.
¿Hay un repositorio oficial?
La fuente confirma que AngelSpec es de código abierto, pero no especifica el repositorio exacto (GitHub, Hugging Face u otra plataforma) en el texto disponible.
Qué falta confirmar
La fuente no detalla las seis arquitecturas soportadas específicamente, ni menciona si AngelSpec incluye modelos preentrenados o solo la infraestructura de entrenamiento. Tampoco se especifica disponibilidad de checkpoints públicos ni fechas de actualización previstas.
En Inteligencia Artificial creemos que iniciativas como AngelSpec aceleran la democratización de técnicas avanzadas de optimización, permitiendo que más equipos mejoren la latencia de sus modelos sin crear dependencias de infraestructura propietaria.
Fuente: www.marktechpost.com

Deja una respuesta
Lo siento, debes estar conectado para publicar un comentario.