Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Cada sesión dura 2 horas
Día 1: Sesión 1: Resumen del Negocio sobre Por Qué Big Data BI en el Gobierno
- Estudios de caso de NIH, DoE
- Tasa de adaptación de Big Data en agencias gubernamentales y cómo están alineando sus operaciones futuras alrededor del análisis predictivo de Big Data
- Áreas de aplicación a gran escala en DoD, NSA, IRS, USDA, etc.
- Interfaz de Big Data con datos legados
- Comprensión básica de las tecnologías habilitadoras en el análisis predictivo
- Integración de datos y visualización de paneles de control
- Gestión de fraudes
- Generación de reglas de negocio/detección de fraudes
- Detección de amenazas y perfilado
- Análisis de costos y beneficios para la implementación de Big Data
Día 1: Sesión 2: Introducción a Big Data-1
- Características principales de Big Data: volumen, variedad, velocidad y veracidad. Arquitectura MPP para el volumen.
- Almacenes de datos: esquema estático, conjunto de datos de evolución lenta
- Bases de datos MPP como Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
- Soluciones basadas en Hadoop: sin condiciones sobre la estructura del conjunto de datos.
- Patrón típico: HDFS, MapReduce (crunch), recuperación desde HDFS
- Por lotes: apto para análisis/no interactivo
- Volumen: datos de streaming CEP
- Elecciones típicas: productos CEP (p. ej., Infostreams, Apama, MarkLogic, etc.)
- Menos listos para producción: Storm/S4
- Bases de datos NoSQL (columnares y clave-valor): mejor aptas como complemento analítico al almacén de datos/base de datos
Día 1: Sesión 3: Introducción a Big Data-2
Soluciones NoSQL
- Almacén KV - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- Almacén KV - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- Almacén KV (jerárquico) - GT.m, Cache
- Almacén KV (ordenado) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- Caché KV - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Almacén de tuplas - Gigaspaces, Coord, Apache River
- Base de datos de objetos - ZopeDB, DB40, Shoal
- Almacén de documentos - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Almacén columnar ancho - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Variedades de datos: Introducción al problema de limpieza de datos en Big Data
- RDBMS: estructura/esquema estático, no promueve un entorno ágil y exploratorio.
- NoSQL: semiestructurado, suficiente estructura para almacenar datos sin un esquema exacto antes de almacenarlos
- Problemas de limpieza de datos
Día 1: Sesión 4: Introducción a Big Data-3: Hadoop
- ¿Cuándo seleccionar Hadoop?
- ESTRUCTURADO: los almacenes de datos/bases de datos empresariales pueden almacenar datos masivos (a un costo) pero imponen estructura (no bueno para la exploración activa)
- Datos SEMIESTRUCTURADOS: difícil de hacer con soluciones tradicionales (DW/DB)
- Almacenamiento de datos = enorme esfuerzo y estático incluso después de la implementación
- Para la variedad y el volumen de datos, procesado en hardware comercial: HADOOP
- Se necesita hardware comercial para crear un clúster Hadoop
Introducción a MapReduce/HDFS
- MapReduce: distribución de la computación en múltiples servidores
- HDFS: hace los datos disponibles localmente para el proceso de computación (con redundancia)
- Datos: pueden ser no estructurados/sin esquema (a diferencia de RDBMS)
- Responsabilidad del desarrollador de darle sentido a los datos
- Programación MapReduce = trabajo con Java (pros/contras), carga manual de datos en HDFS
Día 2: Sesión 1: Ecosistema de Big Data: Construyendo Big Data ETL: universo de herramientas de Big Data, cuál usar y cuándo
- Hadoop vs. Otras soluciones NoSQL
- Para acceso interactivo y aleatorio a datos
- Hbase (base de datos orientada a columnas) sobre Hadoop
- Acceso aleatorio a datos pero con restricciones (máx. 1 PB)
- No bueno para análisis ad-hoc, bueno para registro, conteo, series temporales
- Sqoop - Importación desde bases de datos a Hive o HDFS (acceso JDBC/ODBC)
- Flume: flujo de datos (p. ej., datos de registro) a HDFS
Día 2: Sesión 2: Sistema de Gestión de Big Data
- Movimiento de partes, inicio/fallo de nodos de cómputo: ZooKeeper - Para servicios de configuración/coordinación/nombrado
- Flujo de trabajo/pipeline complejo: Oozie: gestionar flujo de trabajo, dependencias, cadena en secuencia
- Despliegue, configuración, gestión de clústeres, actualización, etc. (admin de sistemas): Ambari
- En la nube: Whirr
Día 2: Sesión 3: Análisis predictivo en Inteligencia de Negocios-1: Técnicas fundamentales y BI basado en aprendizaje automático
- Introducción al aprendizaje automático
- Técnicas de clasificación de aprendizaje
- Predicción bayesiana: preparación del archivo de entrenamiento
- Máquina de Vectores de Soporte
- Álgebra p-Tree KNN y minería vertical
- Redes Neuronales
- Problema de variables grandes en Big Data: Bosque Aleatorio (RF)
- Problema de automatización en Big Data: Ensamble de modelos múltiples RF
- Automatización a través de Soft10-M
- Herramienta de análisis de texto: Treeminer
- Aprendizaje ágil
- Aprendizaje basado en agentes
- Aprendizaje distribuido
- Introducción a herramientas de código abierto para análisis predictivo: R, Rapidminer, Mahut
Día 2: Sesión 4: Ecosistema de análisis predictivo-2: Problemas comunes de análisis predictivo en el gobierno
- Análisis de información
- Análisis de visualización
- Análisis predictivo estructurado
- Análisis predictivo no estructurado
- Perfilado de amenazas/fraude/proveedores
- Motor de recomendación
- Detección de patrones
- Descubrimiento de reglas/escenarios: fallo, fraude, optimización
- Descubrimiento de causas raíz
- Análisis de sentimiento
- Análisis de CRM
- Análisis de red
- Análisis de texto
- Revisión asistida por tecnología
- Análisis de fraude
- Análisis en tiempo real
Día 3: Sesión 1: Análisis en tiempo real y escalable sobre Hadoop
- Por qué los algoritmos de análisis comunes fallan en Hadoop/HDFS
- Apache Hama: para computación distribuida sincronizada en bloque
- Apache SPARK: para computación en clúster para análisis en tiempo real
- Laboratorio de Gráficos de CMU2: Enfoque asíncrono basado en gráficos para computación distribuida
- Enfoque basado en Álgebra KNN p desde Treeminer para reducir el costo de hardware de operación
Día 3: Sesión 2: Herramientas para eDiscovery y Forensia
- eDiscovery sobre Big Data vs. datos legados: comparación de costo y rendimiento
- Codificación predictiva y revisión asistida por tecnología (TAR)
- Demostración en vivo de un producto TAR (vMiner) para entender cómo funciona TAR para un descubrimiento más rápido
- Indexado más rápido a través de HDFS: velocidad de datos
- NLP o Procesamiento del Lenguaje Natural: varias técnicas y productos de código abierto
- eDiscovery en idiomas extranjeros: tecnología para el procesamiento de idiomas extranjeros
Día 3: Sesión 3: Big Data BI para Ciberseguridad: Entendiendo las vistas completas de 360 grados desde la recopilación rápida de datos hasta la identificación de amenazas
- Entendiendo los básicos del análisis de seguridad: superficie de ataque, configuración de seguridad incorrecta, defensas del host
- Infraestructura de red/Gran tubería de datos/ETL de respuesta para análisis en tiempo real
- Prescriptivo vs. predictivo: Reglas fijas basadas en reglas vs. auto-descubrimiento de reglas de amenazas desde metadatos
Día 3: Sesión 4: Big Data en USDA: Aplicación en la Agricultura
- Introducción a IoT (Internet de las Cosas) para la agricultura: Big Data basado en sensores y control
- Introducción al imágenes por satélite y su aplicación en la agricultura
- Integración de datos de sensores e imágenes para fertilidad del suelo, recomendación de cultivo y pronóstico
- Seguro agrícola y Big Data
- Pronóstico de pérdida de cultivos
Día 4: Sesión 1: Prevención de fraudes BI desde Big Data en el Gobierno: Análisis de fraude
- Clasificación básica del análisis de fraude: basado en reglas vs. análisis predictivo
- Aprendizaje automático supervisado vs. no supervisado para la detección de patrones de fraude
- Fraude de proveedores/sobre cobro por proyectos
- Fraude en Medicare y Medicaid: técnicas de detección de fraude para el procesamiento de reclamaciones
- Fraudes en reembolsos de viajes
- Fraudes en reembolsos del IRS
- Se darán estudios de caso y demostraciones en vivo donde haya datos disponibles.
Día 4: Sesión 2: Análisis de Redes Sociales: Recopilación e inteligencia de información
- API de ETL de Big Data para extraer datos de redes sociales
- Texto, imagen, metadatos y video
- Análisis de sentimiento desde el flujo de redes sociales
- Filtrado contextual y no contextual del flujo de redes sociales
- Panel de control de redes sociales para integrar diversas redes sociales
- Perfilado automatizado de perfiles de redes sociales
- Se dará una demostración en vivo de cada análisis a través de la herramienta Treeminer.
Día 4: Sesión 3: Análisis de Big Data en procesamiento de imágenes y flujos de video
- Técnicas de almacenamiento de imágenes en Big Data: Solución de almacenamiento para datos que exceden petabytes
- LTFS y LTO
- GPFS-LTFS (Solución de almacenamiento por capas para datos de imágenes grandes)
- Fundamentos del análisis de imágenes
- Reconocimiento de objetos
- Segmentación de imágenes
- Seguimiento de movimiento
- Reconstrucción de imágenes 3D
Día 4: Sesión 4: Aplicaciones de Big Data en NIH
- Áreas emergentes de Bioinformática
- Meta-genómica y problemas de minería de Big Data
- Análisis predictivo de Big Data para farmacogenómica, metabolómica y proteómica
- Big Data en el proceso de genómica aguas abajo
- Aplicación del análisis predictivo de Big Data en salud pública
Panel de control de Big Data para acceso rápido a datos diversos y visualización
- Integración de la plataforma de aplicación existente con el panel de control de Big Data
- Gestión de Big Data
- Estudio de caso de un panel de control de Big Data: Tableau y Pentaho
- Uso de la app de Big Data para impulsar servicios basados en ubicación en el gobierno
- Sistema de seguimiento y gestión
Día 5: Sesión 1: Cómo justificar la implementación de Big Data BI dentro de una organización
- Definir el ROI para la implementación de Big Data
- Estudios de caso para ahorrar tiempo de analista para la recopilación y preparación de datos: aumento de la ganancia de productividad
- Estudios de caso de ganancia de ingresos por ahorrar costos de base de datos licenciada
- Ganancia de ingresos de servicios basados en ubicación
- Ahorro por prevención de fraudes
- Un enfoque de hoja de cálculo integrada para calcular aproximadamente el gasto vs. ganancia de ingresos/ahorro de la implementación de Big Data
Día 5: Sesión 2: Procedimiento paso a paso para reemplazar el sistema de datos legado por un sistema de Big Data
- Entendiendo el mapa de ruta práctico de migración de Big Data
- Qué información importante se necesita antes de diseñar una implementación de Big Data
- Cuales son las diferentes formas de calcular el volumen, velocidad, variedad y veracidad de los datos
- Cómo estimar el crecimiento de datos
- Estudios de caso
Día 5: Sesión 4: Revisión de proveedores de Big Data y revisión de sus productos. Sesión de Pregunta/Respuesta
- Accenture
- APTEAN (Antes CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (Antes 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Parte de EMC)
Requerimientos
- Conocimientos básicos sobre la operación empresarial y los sistemas de datos en el gobierno en su campo
- Comprensión básica de SQL/Oracle o base de datos relacional
- Comprensión básica de Estadística (nivel de hoja de cálculo)
35 Horas
Reseñas (1)
La capacidad del formador de alinear el curso con los requisitos de la organización, y no solo proporcionarlo por el mero hecho de impartirlo.
Masilonyane - Revenue Services Lesotho
Curso - Big Data Business Intelligence for Govt. Agencies
Traducción Automática