Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Duración 21 horas
Temario del curso
Introducción a la IA multimodal y Ollama
- Visión general del aprendizaje multimodal.
- Principales desafíos en la integración visión-lenguaje.
- Capacidades y arquitectura de Ollama.
Configuración del entorno de Ollama
- Instalación y configuración de Ollama.
- Trabajo con despliegue de modelos locales.
- Integración de Ollama con Python y Jupyter.
Trabajo con entradas multimodales
- Integración de texto e imagen.
- Incorporación de audio y datos estructurados.
- Diseño de flujos de preprocesamiento.
Aplicaciones de comprensión de documentos
- Extracción de información estructurada de PDFs e imágenes.
- Combinación de OCR con modelos de lenguaje.
- Construcción de flujos de trabajo inteligentes para el análisis de documentos.
Respuesta a preguntas visuales (VQA)
- Configuración de conjuntos de datos y benchmarks para VQA.
- Entrenamiento y evaluación de modelos multimodales.
- Construcción de aplicaciones interactivas de VQA.
Diseño de agentes multimodales
- Principios del diseño de agentes con razonamiento multimodal.
- Combinación de percepción, lenguaje y acción.
- Despliegue de agentes para casos de uso reales.
Integración y optimización avanzadas
- Ajuste fino de modelos multimodales con Ollama.
- Optimización del rendimiento de inferencia.
- Consideraciones de escalabilidad y despliegue.
Resumen y próximos pasos
Requerimientos
- Sólido entendimiento de los conceptos de aprendizaje automático.
- Experiencia con marcos de aprendizaje profundo como PyTorch o TensorFlow.
- Familiaridad con el procesamiento de lenguaje natural y la visión por computadora.
Público objetivo
- Ingenieros de aprendizaje automático.
- Investigadores en IA.
- Desarrolladores de producto que integren flujos de trabajo de visión y texto.