Temario del curso
Introducción al Aprendizaje Automático
- Tipos de aprendizaje automático: supervisado vs no supervisado.
- Del aprendizaje estadístico al aprendizaje automático.
- El flujo de trabajo de la minería de datos: comprensión del negocio, preparación de datos, modelado y despliegue.
- Elección del algoritmo adecuado para la tarea.
- Sobreajuste (overfitting) y el equilibrio entre sesgo y varianza.
Visión general de Python y bibliotecas de ML
- Por qué utilizar lenguajes de programación para ML.
- Elegir entre R y Python.
- Taller intensivo de Python y Cuadernos Jupyter.
- Bibliotecas de Python: pandas, NumPy, scikit-learn, matplotlib, seaborn.
Pruebas y evaluación de algoritmos de ML
- Generalización, sobreajuste (overfitting) y validación del modelo.
- Estrategias de evaluación: partición de datos (holdout), validación cruzada y bootstrap.
- Métricas para regresión: ME, MSE, RMSE, MAPE.
- Métricas para clasificación: precisión, matriz de confusión y clases desequilibradas.
- Visualización del rendimiento del modelo: curva de beneficio, curva ROC, curva de elevación (lift).
- Selección de modelos y búsqueda en cuadrícula para ajuste de parámetros.
Preparación de datos
- Importación y almacenamiento de datos en Python.
- Análisis exploratorio y estadísticas resumidas.
- Manejo de valores faltantes y valores atípicos.
- Estandarización, normalización y transformación.
- Recodificación de datos cualitativos y manipulación de datos con pandas.
Algoritmos de clasificación
- Clasificación binaria vs multiclase.
- Regresión logística y funciones discriminantes.
- Bayes ingenuo (Naïve Bayes), k vecinos más cercanos (k-NN).
- Árboles de decisión: CART, Bosques Aleatorios (Random Forests), Bagging, Boosting, XGBoost.
- Máquinas de vectores de soporte (SVM) y núcleos (kernels).
- Técnicas de aprendizaje por conjuntos (ensemble learning).
Regresión y predicción numérica
- Mínimos cuadrados y selección de variables.
- Métodos de regularización: L1, L2.
- Regresión polinómica y modelos no lineales.
- Árboles de regresión y splines.
Aprendizaje no supervisado
- Técnicas de agrupamiento (clustering): k-medias (k-means), k-medoides, agrupamiento jerárquico, SOMs.
- Reducción de dimensionalidad: PCA, análisis factorial, SVD.
- Ajuste multidimensional.
Minería de texto
- Preprocesamiento de texto y tokenización.
- Bolsa de palabras (bag-of-words), lematización y obtención de la raíz de las palabras (stemming).
- Análisis de sentimientos y frecuencia de palabras.
- Visualización de datos de texto con nubes de palabras.
Sistemas de recomendación
- Filtrado colaborativo basado en usuarios y basado en elementos.
- Diseño y evaluación de motores de recomendación.
Minería de patrones de asociación
- Conjuntos de ítems frecuentes y algoritmo Apriori.
- Análisis del mercado de cestas (market basket) y ratio de elevación (lift).
Detección de valores atípicos
- Análisis de valores extremos.
- Métodos basados en distancia y densidad.
- Detección de valores atípicos en datos de alta dimensionalidad.
Caso de estudio de aprendizaje automático
- Comprensión del problema empresarial.
- Preparación de datos e ingeniería de características.
- Selección de modelos y ajuste de parámetros.
- Evaluación y presentación de hallazgos.
- Despliegue (deployment).
Resumen y próximos pasos
Requerimientos
- Conocimientos básicos de estadística y álgebra lineal.
- Familiaridad con conceptos de análisis de datos o inteligencia empresarial.
- Se recomienda tener alguna experiencia previa en programación (preferiblemente Python o R).
- Interés en aprender aprendizaje automático aplicado para proyectos basados en datos.
Audiencia objetivo
- Analicistas y científicos de datos.
- Estadísticos y profesionales de la investigación.
- Desarrolladores y profesionales de TI que exploran herramientas de aprendizaje automático.
- Cualquier persona involucrada en proyectos de ciencia de datos o análisis predictivo.
Reseñas (3)
A pesar de tener que faltar un día debido a reuniones con clientes, siento que tengo una comprensión mucho más clara de los procesos y técnicas utilizados en el Aprendizaje Automático y cuándo usaría un enfoque en lugar de otro. Nuestro desafío ahora es practicar lo que hemos aprendido y comenzar a aplicarlo a nuestro dominio de problemas.
Richard Blewett - Rock Solid Knowledge Ltd
Curso - Machine Learning – Data science
Traducción Automática
Me gustó que la formación se centrara en ejemplos y codificación. Pensé que era imposible incluir tanto contenido en tres días de formación, pero me equivoqué. La formación cubrió muchos temas y todo se realizó de manera muy detallada (especialmente el ajuste de los parámetros del modelo, no esperaba que hubiera tiempo para esto y quedé muy sorprendido).
Bartosz Rosiek - GE Medical Systems Polska Sp. Zoo
Curso - Machine Learning – Data science
Traducción Automática
Muestra muchos métodos con scripts prepreparados, materiales muy bien preparados y fáciles de rastrear.
Kamila Begej - GE Medical Systems Polska Sp. Zoo
Curso - Machine Learning – Data science
Traducción Automática