Ponte en Contacto

Temario del curso

Cada sesión dura 2 horas

Día 1: Sesión 1: Resumen del Negocio sobre Por Qué Big Data BI en el Gobierno

  • Estudios de caso de NIH, DoE
  • Tasa de adaptación de Big Data en agencias gubernamentales y cómo están alineando sus operaciones futuras alrededor del análisis predictivo de Big Data
  • Áreas de aplicación a gran escala en DoD, NSA, IRS, USDA, etc.
  • Interfaz de Big Data con datos legados
  • Comprensión básica de las tecnologías habilitadoras en el análisis predictivo
  • Integración de datos y visualización de paneles de control
  • Gestión de fraudes
  • Generación de reglas de negocio/detección de fraudes
  • Detección de amenazas y perfilado
  • Análisis de costos y beneficios para la implementación de Big Data

Día 1: Sesión 2: Introducción a Big Data-1

  • Características principales de Big Data: volumen, variedad, velocidad y veracidad. Arquitectura MPP para el volumen.
  • Almacenes de datos: esquema estático, conjunto de datos de evolución lenta
  • Bases de datos MPP como Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
  • Soluciones basadas en Hadoop: sin condiciones sobre la estructura del conjunto de datos.
  • Patrón típico: HDFS, MapReduce (crunch), recuperación desde HDFS
  • Por lotes: apto para análisis/no interactivo
  • Volumen: datos de streaming CEP
  • Elecciones típicas: productos CEP (p. ej., Infostreams, Apama, MarkLogic, etc.)
  • Menos listos para producción: Storm/S4
  • Bases de datos NoSQL (columnares y clave-valor): mejor aptas como complemento analítico al almacén de datos/base de datos

Día 1: Sesión 3: Introducción a Big Data-2

Soluciones NoSQL

  • Almacén KV - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • Almacén KV - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • Almacén KV (jerárquico) - GT.m, Cache
  • Almacén KV (ordenado) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • Caché KV - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Almacén de tuplas - Gigaspaces, Coord, Apache River
  • Base de datos de objetos - ZopeDB, DB40, Shoal
  • Almacén de documentos - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Almacén columnar ancho - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Variedades de datos: Introducción al problema de limpieza de datos en Big Data

  • RDBMS: estructura/esquema estático, no promueve un entorno ágil y exploratorio.
  • NoSQL: semiestructurado, suficiente estructura para almacenar datos sin un esquema exacto antes de almacenarlos
  • Problemas de limpieza de datos

Día 1: Sesión 4: Introducción a Big Data-3: Hadoop

  • ¿Cuándo seleccionar Hadoop?
  • ESTRUCTURADO: los almacenes de datos/bases de datos empresariales pueden almacenar datos masivos (a un costo) pero imponen estructura (no bueno para la exploración activa)
  • Datos SEMIESTRUCTURADOS: difícil de hacer con soluciones tradicionales (DW/DB)
  • Almacenamiento de datos = enorme esfuerzo y estático incluso después de la implementación
  • Para la variedad y el volumen de datos, procesado en hardware comercial: HADOOP
  • Se necesita hardware comercial para crear un clúster Hadoop

Introducción a MapReduce/HDFS

  • MapReduce: distribución de la computación en múltiples servidores
  • HDFS: hace los datos disponibles localmente para el proceso de computación (con redundancia)
  • Datos: pueden ser no estructurados/sin esquema (a diferencia de RDBMS)
  • Responsabilidad del desarrollador de darle sentido a los datos
  • Programación MapReduce = trabajo con Java (pros/contras), carga manual de datos en HDFS

Día 2: Sesión 1: Ecosistema de Big Data: Construyendo Big Data ETL: universo de herramientas de Big Data, cuál usar y cuándo

  • Hadoop vs. Otras soluciones NoSQL
  • Para acceso interactivo y aleatorio a datos
  • Hbase (base de datos orientada a columnas) sobre Hadoop
  • Acceso aleatorio a datos pero con restricciones (máx. 1 PB)
  • No bueno para análisis ad-hoc, bueno para registro, conteo, series temporales
  • Sqoop - Importación desde bases de datos a Hive o HDFS (acceso JDBC/ODBC)
  • Flume: flujo de datos (p. ej., datos de registro) a HDFS

Día 2: Sesión 2: Sistema de Gestión de Big Data

  • Movimiento de partes, inicio/fallo de nodos de cómputo: ZooKeeper - Para servicios de configuración/coordinación/nombrado
  • Flujo de trabajo/pipeline complejo: Oozie: gestionar flujo de trabajo, dependencias, cadena en secuencia
  • Despliegue, configuración, gestión de clústeres, actualización, etc. (admin de sistemas): Ambari
  • En la nube: Whirr

Día 2: Sesión 3: Análisis predictivo en Inteligencia de Negocios-1: Técnicas fundamentales y BI basado en aprendizaje automático

  • Introducción al aprendizaje automático
  • Técnicas de clasificación de aprendizaje
  • Predicción bayesiana: preparación del archivo de entrenamiento
  • Máquina de Vectores de Soporte
  • Álgebra p-Tree KNN y minería vertical
  • Redes Neuronales
  • Problema de variables grandes en Big Data: Bosque Aleatorio (RF)
  • Problema de automatización en Big Data: Ensamble de modelos múltiples RF
  • Automatización a través de Soft10-M
  • Herramienta de análisis de texto: Treeminer
  • Aprendizaje ágil
  • Aprendizaje basado en agentes
  • Aprendizaje distribuido
  • Introducción a herramientas de código abierto para análisis predictivo: R, Rapidminer, Mahut

Día 2: Sesión 4: Ecosistema de análisis predictivo-2: Problemas comunes de análisis predictivo en el gobierno

  • Análisis de información
  • Análisis de visualización
  • Análisis predictivo estructurado
  • Análisis predictivo no estructurado
  • Perfilado de amenazas/fraude/proveedores
  • Motor de recomendación
  • Detección de patrones
  • Descubrimiento de reglas/escenarios: fallo, fraude, optimización
  • Descubrimiento de causas raíz
  • Análisis de sentimiento
  • Análisis de CRM
  • Análisis de red
  • Análisis de texto
  • Revisión asistida por tecnología
  • Análisis de fraude
  • Análisis en tiempo real

Día 3: Sesión 1: Análisis en tiempo real y escalable sobre Hadoop

  • Por qué los algoritmos de análisis comunes fallan en Hadoop/HDFS
  • Apache Hama: para computación distribuida sincronizada en bloque
  • Apache SPARK: para computación en clúster para análisis en tiempo real
  • Laboratorio de Gráficos de CMU2: Enfoque asíncrono basado en gráficos para computación distribuida
  • Enfoque basado en Álgebra KNN p desde Treeminer para reducir el costo de hardware de operación

Día 3: Sesión 2: Herramientas para eDiscovery y Forensia

  • eDiscovery sobre Big Data vs. datos legados: comparación de costo y rendimiento
  • Codificación predictiva y revisión asistida por tecnología (TAR)
  • Demostración en vivo de un producto TAR (vMiner) para entender cómo funciona TAR para un descubrimiento más rápido
  • Indexado más rápido a través de HDFS: velocidad de datos
  • NLP o Procesamiento del Lenguaje Natural: varias técnicas y productos de código abierto
  • eDiscovery en idiomas extranjeros: tecnología para el procesamiento de idiomas extranjeros

Día 3: Sesión 3: Big Data BI para Ciberseguridad: Entendiendo las vistas completas de 360 grados desde la recopilación rápida de datos hasta la identificación de amenazas

  • Entendiendo los básicos del análisis de seguridad: superficie de ataque, configuración de seguridad incorrecta, defensas del host
  • Infraestructura de red/Gran tubería de datos/ETL de respuesta para análisis en tiempo real
  • Prescriptivo vs. predictivo: Reglas fijas basadas en reglas vs. auto-descubrimiento de reglas de amenazas desde metadatos

Día 3: Sesión 4: Big Data en USDA: Aplicación en la Agricultura

  • Introducción a IoT (Internet de las Cosas) para la agricultura: Big Data basado en sensores y control
  • Introducción al imágenes por satélite y su aplicación en la agricultura
  • Integración de datos de sensores e imágenes para fertilidad del suelo, recomendación de cultivo y pronóstico
  • Seguro agrícola y Big Data
  • Pronóstico de pérdida de cultivos

Día 4: Sesión 1: Prevención de fraudes BI desde Big Data en el Gobierno: Análisis de fraude

  • Clasificación básica del análisis de fraude: basado en reglas vs. análisis predictivo
  • Aprendizaje automático supervisado vs. no supervisado para la detección de patrones de fraude
  • Fraude de proveedores/sobre cobro por proyectos
  • Fraude en Medicare y Medicaid: técnicas de detección de fraude para el procesamiento de reclamaciones
  • Fraudes en reembolsos de viajes
  • Fraudes en reembolsos del IRS
  • Se darán estudios de caso y demostraciones en vivo donde haya datos disponibles.

Día 4: Sesión 2: Análisis de Redes Sociales: Recopilación e inteligencia de información

  • API de ETL de Big Data para extraer datos de redes sociales
  • Texto, imagen, metadatos y video
  • Análisis de sentimiento desde el flujo de redes sociales
  • Filtrado contextual y no contextual del flujo de redes sociales
  • Panel de control de redes sociales para integrar diversas redes sociales
  • Perfilado automatizado de perfiles de redes sociales
  • Se dará una demostración en vivo de cada análisis a través de la herramienta Treeminer.

Día 4: Sesión 3: Análisis de Big Data en procesamiento de imágenes y flujos de video

  • Técnicas de almacenamiento de imágenes en Big Data: Solución de almacenamiento para datos que exceden petabytes
  • LTFS y LTO
  • GPFS-LTFS (Solución de almacenamiento por capas para datos de imágenes grandes)
  • Fundamentos del análisis de imágenes
  • Reconocimiento de objetos
  • Segmentación de imágenes
  • Seguimiento de movimiento
  • Reconstrucción de imágenes 3D

Día 4: Sesión 4: Aplicaciones de Big Data en NIH

  • Áreas emergentes de Bioinformática
  • Meta-genómica y problemas de minería de Big Data
  • Análisis predictivo de Big Data para farmacogenómica, metabolómica y proteómica
  • Big Data en el proceso de genómica aguas abajo
  • Aplicación del análisis predictivo de Big Data en salud pública

Panel de control de Big Data para acceso rápido a datos diversos y visualización

  • Integración de la plataforma de aplicación existente con el panel de control de Big Data
  • Gestión de Big Data
  • Estudio de caso de un panel de control de Big Data: Tableau y Pentaho
  • Uso de la app de Big Data para impulsar servicios basados en ubicación en el gobierno
  • Sistema de seguimiento y gestión

Día 5: Sesión 1: Cómo justificar la implementación de Big Data BI dentro de una organización

  • Definir el ROI para la implementación de Big Data
  • Estudios de caso para ahorrar tiempo de analista para la recopilación y preparación de datos: aumento de la ganancia de productividad
  • Estudios de caso de ganancia de ingresos por ahorrar costos de base de datos licenciada
  • Ganancia de ingresos de servicios basados en ubicación
  • Ahorro por prevención de fraudes
  • Un enfoque de hoja de cálculo integrada para calcular aproximadamente el gasto vs. ganancia de ingresos/ahorro de la implementación de Big Data

Día 5: Sesión 2: Procedimiento paso a paso para reemplazar el sistema de datos legado por un sistema de Big Data

  • Entendiendo el mapa de ruta práctico de migración de Big Data
  • Qué información importante se necesita antes de diseñar una implementación de Big Data
  • Cuales son las diferentes formas de calcular el volumen, velocidad, variedad y veracidad de los datos
  • Cómo estimar el crecimiento de datos
  • Estudios de caso

Día 5: Sesión 4: Revisión de proveedores de Big Data y revisión de sus productos. Sesión de Pregunta/Respuesta

  • Accenture
  • APTEAN (Antes CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (Antes 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Parte de EMC)

Requerimientos

  • Conocimientos básicos sobre la operación empresarial y los sistemas de datos en el gobierno en su campo
  • Comprensión básica de SQL/Oracle o base de datos relacional
  • Comprensión básica de Estadística (nivel de hoja de cálculo)
 35 Horas

Número de participantes


Precio por participante

Reseñas (1)

Próximos cursos

Categorías Relacionadas