dataqbs

RBS-Attention: Prefill Rápido y Escaso con Radio Limitado para Modelos de Lenguaje Extendido de Gran Contexto

· Fuente: arXiv cs.AI

Los modelos de lenguaje de gran escala que pueden trabajar con contextos extensos enfrentan una limitación importante durante la fase de pre‑llenado, ya que el mecanismo de auto‑atención densa procesa todo el texto de entrada antes de iniciar la generación. Para reducir este coste, se han propuesto técnicas que seleccionan bloques de forma dispersa, pero estas pueden ocultar tokens cruciales entre muchos irrelevantes, un problema que los autores denominan “dilución media”. El artículo presenta RBS‑Attention, una estrategia de pre‑llenado escaso que no requiere entrenamiento adicional y que combina dos ramas de selección complementarias. La primera rama, basada en centroides, captura la relevancia promedio de los bloques; la segunda, denominada rama de rescate, utiliza el radio máximo de la clave del bloque y una distribución dependiente del prompt, la capa y la cabeza para detectar bloques que podrían ser subvalorados. Cada rama se umbra de forma independiente y sus máscaras se combinan, permitiendo integrar los bloques de rescate sin alterar la ejecución regular de FlashAttention con bloques dispersos.

En pruebas realizadas con GPUs H100, RBS‑Attention acelera la atención de pre‑llenado en más de 20 veces frente a una ejecución aislada y casi 12 veces frente a la implementación de vLLM, reduciendo también el tiempo total hasta el primer token en casi seis veces para un contexto de 128 k tokens. La pérdida de precisión es mínima, con una exactitud RULER de 88.65 frente a 89.52 del método denso, y los resultados en los benchmarks LongBench‑v2, InfiniteBench y Video‑MME confirman la calidad del enfoque. Esta innovación es relevante porque permite que los grandes modelos de lenguaje procesen entradas mucho más largas de forma más rápida y con un consumo de recursos más bajo, facilitando su aplicación en tareas que requieren análisis extensivo de texto, como la revisión de documentos legales o la generación de contenido a gran escala.

Leer artículo original en arXiv cs.AI

Este resumen es una síntesis informativa elaborada por dataqbs.com. Todos los derechos sobre el contenido original pertenecen a su autor y al medio de comunicación citado. Nosotros solo actuamos como curadores de noticias tecnológicas, sin reclamar autoría alguna.

Lee esto en English · Deutsch