Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Duración 14 horas
Temario del curso
Fundamentos de Producción de Tencent Hunyuan
- Descripción general de escenarios de distribución de modelos Tencent Hunyuan
- Características de producción de modelos grandes y MoE
- Principales cuellos de botella de latencia, rendimiento y costos
- Definición de objetivos de nivel de servicio (SLO) para cargas de trabajo de inferencia
Arquitectura de Implementación y Flujo de Distribución
- Componentes principales de una pila de inferencia en producción
- Elegir entre modelos de implementación con contenedores, locales o en la nube
- Fundamentos de carga de modelos, enrutamiento de solicitudes y asignación de GPU
- Diseño para confiabilidad y simplicidad operativa
Optimización de Latencia en la Práctica
- Uso de motores de inferencia optimizados como TensorRT cuando corresponda
- Conceptos de KV-cache y ajuste práctico del caché
- Reducción de sobrecarga durante el inicio, calibración (warmup) y respuesta
- Medición del tiempo hasta el primer token y velocidad de generación de tokens
Rendimiento, Agrupación (Batching) y Eficiencia de GPU
- Estrategias de agrupación continua y por solicitudes
- Gestión de concurrencia y comportamiento de colas
- Mejora del uso de GPU sin afectar la experiencia del usuario
- Manejo de solicitudes de contexto largo y cargas de trabajo mixtas
Cuantización y Control de Costos
- Por qué la cuantización es importante para la distribución en producción
- Compensaciones prácticas entre FP16, INT8 y otras opciones comunes de precisión
- Equilibrio entre calidad del modelo, latencia y costo de infraestructura
- Construcción de una lista de verificación simple para optimización de costos
Operaciones, Monitoreo y Revisión de Preparación
- Disparadores de escalado automático para servicios de inferencia
- Monitoreo de latencia, rendimiento, uso de caché y salud de la GPU
- Fundamentos de registro (logging), alertas y respuesta a incidentes
- Revisión de un caso de implementación de referencia y creación de un plan de mejora
Requerimientos
- Conocimiento básico de implementación y flujos de trabajo de inferencia de modelos de lenguaje grande (LLM)
- Experiencia con contenedores, infraestructura en la nube o local, y servicios basados en API
- Conocimientos prácticos de Python o tareas de ingeniería de sistemas
Audiencia
- Ingenieros de ML que implementan LLMs en producción
- Ingenieros de plataforma responsables de servicios de inferencia basados en GPU
- Arquitectos de soluciones que diseñan plataformas escalables de distribución de IA