Ponte en Contacto

Temario del curso

Fundamentos de Producción de Tencent Hunyuan

  • Descripción general de escenarios de distribución de modelos Tencent Hunyuan
  • Características de producción de modelos grandes y MoE
  • Principales cuellos de botella de latencia, rendimiento y costos
  • Definición de objetivos de nivel de servicio (SLO) para cargas de trabajo de inferencia

Arquitectura de Implementación y Flujo de Distribución

  • Componentes principales de una pila de inferencia en producción
  • Elegir entre modelos de implementación con contenedores, locales o en la nube
  • Fundamentos de carga de modelos, enrutamiento de solicitudes y asignación de GPU
  • Diseño para confiabilidad y simplicidad operativa

Optimización de Latencia en la Práctica

  • Uso de motores de inferencia optimizados como TensorRT cuando corresponda
  • Conceptos de KV-cache y ajuste práctico del caché
  • Reducción de sobrecarga durante el inicio, calibración (warmup) y respuesta
  • Medición del tiempo hasta el primer token y velocidad de generación de tokens

Rendimiento, Agrupación (Batching) y Eficiencia de GPU

  • Estrategias de agrupación continua y por solicitudes
  • Gestión de concurrencia y comportamiento de colas
  • Mejora del uso de GPU sin afectar la experiencia del usuario
  • Manejo de solicitudes de contexto largo y cargas de trabajo mixtas

Cuantización y Control de Costos

  • Por qué la cuantización es importante para la distribución en producción
  • Compensaciones prácticas entre FP16, INT8 y otras opciones comunes de precisión
  • Equilibrio entre calidad del modelo, latencia y costo de infraestructura
  • Construcción de una lista de verificación simple para optimización de costos

Operaciones, Monitoreo y Revisión de Preparación

  • Disparadores de escalado automático para servicios de inferencia
  • Monitoreo de latencia, rendimiento, uso de caché y salud de la GPU
  • Fundamentos de registro (logging), alertas y respuesta a incidentes
  • Revisión de un caso de implementación de referencia y creación de un plan de mejora

Requerimientos

  • Conocimiento básico de implementación y flujos de trabajo de inferencia de modelos de lenguaje grande (LLM)
  • Experiencia con contenedores, infraestructura en la nube o local, y servicios basados en API
  • Conocimientos prácticos de Python o tareas de ingeniería de sistemas

Audiencia

  • Ingenieros de ML que implementan LLMs en producción
  • Ingenieros de plataforma responsables de servicios de inferencia basados en GPU
  • Arquitectos de soluciones que diseñan plataformas escalables de distribución de IA
 14 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas