Temario del curso
Día 1: Construir los fundamentos — Ingesta, búsqueda y recuperación
Módulo 1: El panorama del ingeniero legal
- Objetivos de aprendizaje — comprender el rol, cómo encaja la IA en el trabajo jurídico y los dos riesgos críticos que atraviesan todo el ecosistema.
- Temas
-
- El rol del ingeniero legal y por qué es demandado actualmente.
- Cómo encaja la IA: eDiscovery, revisión de contratos, investigación jurídica e investigaciones; el modelo EDRM explicado en términos sencillos.
- Construir vs. comprar.
- Los dos riesgos centrales: confidencialidad/privilegio y defensibilidad legal.
Módulo 2: Los datos legales son complejos — Ingesta y extracción
- Objetivos de aprendizaje — enfrentar la realidad de gestionar datos legales a gran escala.
- Temas
- +1.400 tipos de archivos, correos electrónicos y PSTs, documentos escaneados, load files (.dat/.opt); metadatos incrustados que son relevantes.
- Extracción de texto (Tika), OCR y deduplicación como estrategia opcional.
- Lab: Ingesta en FreeEed — construir un pipeline de ingestión sobre un conjunto deliberadamente complejo de documentos (correo/PST, escaneos, load files).
Módulo 3: Búsqueda y recuperación — la base fundamental
- Objetivos de aprendizaje — construir el primitivo central del eDiscovery: encontrar cualquier dato dentro de todo el corpus.
- Temas — búsqueda y indexación de texto completo (Solr/Lucene); relevancia, filtrado por metadatos y fechas; búsqueda en contenido extraído mediante OCR.
- Lab: Búsqueda eDiscovery — indexar un corpus y ejecutar búsquedas estilo eDiscovery real, incluso dentro de escaneos procesados con OCR.
Módulo 4: RAG para documentos legales — con citas fuentes
- Objetivos de aprendizaje — construir RAG sobre documentos legales que cite explícitamente sus fuentes.
- Temas
- Por qué la recuperación, y no el ajuste fino (fine-tuning), es preferible para material sensible: el modelo nunca "absorbe" los documentos completos.
- Agrupación por fragmentos (chunking), embeddings y, sobre todo, citas y procedencia.
- Resumen multi-documento e hilo conversacional.
- Lab: RAG Legal con citas fuentes — construir un sistema de preguntas y respuestas basado en RAG sobre un conjunto de documentos que responde citando las fuentes originales.
Día 2: Garantizar privacidad, defensibilidad y preparación para producción
Módulo 5: Privacidad, privilegio y servicio local — la trampa del privilegio legal
- Objetivos de aprendizaje — mantener los datos legales locales y poder certificarlo.
- Temas
- Dónde va realmente la información cuando se utiliza una IA en la nube.
- Vaiván del privilegio, deber de competencia y el espectro "privado" (contractual vs. físico).
- Caso Morgan v. V2X y por qué lo local es defendible ante tribunales.
- Servicio de modelos locales (Ollama / vLLM) y monitoreo del tráfico saliente.
- Lab: Modelo local + prueba egress — ejecutar un modelo local de extremo a extremo y demostrar, mediante monitoreo, que ningún dato salió del entorno.
Módulo 6: Revisión de IA defendible
- Objetivos de aprendizaje — medir y documentar una revisión de IA para que sea jurídicamente sólida.
- Temas
- Las métricas clave válidas en juicio: recall, elusion, precisión, validación ground-truth; TAR (Revisión Asistida por Tecnología) / aprendizaje activo.
- Transparencia (¿por qué clasificó así este documento?) y reproducibilidad: fijar la versión del modelo, inmutabilizar los parámetros, registrar todo.
- La "instantánea de caso defendible" que permite a terceros reproducir tu revisión un año después y obtener el mismo resultado.
- Lab: Revisión defendible — medir una revisión de IA frente a un ground-truth ciego y producir un paquete reproductible.
Módulo 7: Desplegar — Flujos de trabajo, despliegue privado y gobernanza
- Objetivos de aprendizaje — ensamblar las piezas en un flujo de trabajo, desplegarlo de forma privada y evaluarlo.
- Temas
- Un flujo de trabajo legal multi-etapa (ingesta → búsqueda → resumen → revisión → producción) con intervención humana (human-in-the-loop).
- Fundamentos del despliegue privado/on-premise (containerización; mantener los datos dentro de la organización).
- Gobernanza de IA para el ámbito legal en resumen y evaluación del sistema mediante SAIS-100 (Elephant Scale Secure AI Score).
- Lab: Puntuación y empaquetado — interconectar un flujo de trabajo multi-etapa, puntuarlo con SAIS-100 y empaquetarlo para despliegue privado.
Proyecto final (integrado durante el Día 2)
- Construir una aplicación legal-AI privada y defendible de extremo a extremo : ingestar un corpus desordenado, buscarlo, responder preguntas sobre él con citas usando un modelo local, medir una revisión defendible y empaquetarlo para despliegue privado.
- Los participantes se llevan como producto final un proyecto portafolio que refleja el trabajo real de un ingeniero legal.
Día 3 Opcional / Módulos Avanzados (entregables como un 3er día o como una serie modular)
- Investigaciones: Entidades, relaciones y cronologías — extraer personas/organizaciones/fechas, reconstruir hilos de correo, construir líneas temporales, mapear duplicados cercanos y linaje documental. Lab: construir una línea temporal y vista entidad-relación.
- Flujos de trabajo agénticos y multi-etapa (profundización) — orquestación más rica, análisis contractual, síntesis multi-documento, uso de herramientas y guardrails como principio de diseño. Lab: construir un flujo de trabajo multi-etapa con un punto de control humano.
- Despliegue a escala — despliegue on-premise y appliances, procesamiento distribuido para grandes volúmenes, entornos regulados (CJIS, gobierno, educación superior), dimensionamiento de hardware. Lab: containerizar y escalar un trabajo de procesamiento entre múltiples nodos trabajadores.
- Profundización en gobernanza y cumplimiento normativo — panorama regulatorio de la IA (más de 100 leyes estatales de EE.UU. sobre IA, AI Act de la UE), requisitos de auditoría y una auditoría completa de gobernanza SAIS-100. Lab: auditar un sistema legal-AI frente a una lista de verificación de gobernanza/defensibilidad.
Requerimientos
- Comodidad con Python y APIs básicas.
- Útil: familiaridad a nivel de usuario con LLMs (no se requiere formación previa en ML; construimos el modelo mental durante el curso).
- No se requiere antecedentes legales — los conceptos jurídicos necesarios se enseñan en contexto.
Público objetivo
- Ingenieros de software o IA que transicionan hacia el sector legal-tech.
- Ingenieros de empresas de legal-tech que necesitan profundidad en dominio jurídico.
- Profesionales técnicos del ámbito legal, eDiscovery o gestión de información que quieren construir soluciones, no solo adquirirlas.
- Cualquier persona orientada al rol de "ingeniero legal" o "ingeniero de IA legal".
Reseñas (2)
La práctica estuvo muy interactiva y aplicable al negocio.
Jorge Boscan - Chevron Global Technology Services Company
Curso - Advanced GitHub Copilot & AI for Projects and Infrastructure
Adquirí conocimientos sobre la biblioteca Streamlit de Python y, con seguridad, intentaré utilizarla para mejorar las aplicaciones de mi equipo que se desarrollan en R Shiny.
Michal Maj - XL Catlin Services SE (AXA XL)
Curso - GitHub Copilot for Developers
Traducción Automática