Skip to content

Repository files navigation

Workshop de IA para gente curiosa

De la neurona al agente: portada, 438 slides numeradas y cierre para entender la IA moderna y aplicarla con criterio en tu dia a dia. Desde backpropagation, busqueda heuristica, planning, SAT/CSP, ML clasico, complejidad temporal, incertidumbre, causalidad, interpretabilidad, refuerzo formal, privacidad avanzada, algoritmia para la toma de decisiones y ontologias hasta desplegar agentes en produccion, pasando por Transformers por dentro, RAG, RAG multimodal, fine-tuning, MCP, ControlNet, Hugging Face, Google Colab, evals avanzadas, Agent Workbench, computer-use, load testing LLM, red-team tooling, UX de IA, LLMOps, seguridad agentic, gobernanza, modelos open weights y vibe coding.

Ver presentacion | Actualizado a mayo 2026 (update 05/26)

Contenido

Fundamentos (slides 1-36)

  • Que es (y que no es) la IA
  • Determinismo vs sistemas estocasticos
  • La neurona artificial, redes neuronales, backpropagation, regla de la cadena, símbolos y ejemplo numérico con gradientes
  • Funciones de perdida, optimizadores (Adam, SGD)
  • CNNs para vision, RNNs y LSTMs para secuencias
  • Tokens, embeddings, similitud coseno
  • Entrenamiento vs inferencia, quantizacion (GGUF, bitsandbytes, GPTQ = GPT Quantization, AWQ = Activation-aware Weight Quantization, Q4-Q8)
  • ML clasico esencial: dataset, features, labels, train/test, overfitting y validacion
  • Supervisado vs no supervisado vs refuerzo; clasificacion vs regresion
  • Complejidad temporal en ML: Big-O, entrenamiento vs inferencia y coste por algoritmo
  • Matriz de confusion, precision, recall, F1 y clustering/k-means

IA clasica aplicada (slides 37-88)

  • Busqueda en espacios de estados: BFS, DFS, coste uniforme, greedy, A* y heuristicas admisibles
  • SAT y CSP: variables, dominios, restricciones, propagacion, backtracking y heuristicas
  • Planificacion automatica: estados, acciones, precondiciones, efectos, PDDL y planificacion heuristica
  • IA en juegos: minimax, poda alpha-beta, funciones de evaluacion, Monte Carlo y MCTS
  • Conocimiento simbolico: RDF, RDFS, OWL, SPARQL, Linked Data, ontologias y sistemas expertos
  • Puente practico entre IA clasica, agentes LLM, RAG, GraphRAG y validadores modernos

Arquitecturas y modelos (slides 89-117)

  • LLMs, Transformers, Mixture of Experts, SSM (State Space Model)/Mamba, RWKV/RetNet, Hyena, Jamba y arquitecturas byte/latent
  • Dimensiones de modelos: parametros totales/activos, capas, hidden size, heads, context window
  • Estado del arte mayo 2026: GPT-5.5/5.4, Claude Opus 4.7, Gemini 3.1 Pro Preview (gemini-3.1-pro-preview), gpt-oss, Qwen3.6, DeepSeek-V4, Llama 4 y Mistral 3
  • Atencion en detalle: matrices Q, K, V, multi-head, RoPE
  • Tokenizacion en profundidad: BPE (Byte Pair Encoding), WordPiece, SentencePiece
  • Transformer Explainer como laboratorio visual: texto a tensores, embeddings, QKV, mascara causal, softmax, MLP, residual, LayerNorm, logits y sampling
  • Transfer learning: de ImageNet a GPT
  • Modelos multimodales nativos (texto + imagen + audio + video)
  • Parametros: temperature, top_p, top_k
  • Modelos de razonamiento (thinking tokens)
  • Open weights vs propietario, destilacion, inferencia optimizada
  • Edge AI: modelos en navegador, movil e IoT

Uso practico (slides 118-181)

  • Prompt engineering y context engineering
  • Alucinaciones y como protegerte
  • Structured output / JSON mode con schema
  • Vision, multimodalidad, voz en tiempo real (OpenAI Realtime, ElevenLabs)
  • Generacion de imagenes: difusion, latent space, CFG
  • Entrenamiento de imagen: LoRA, DreamBooth, Textual Inversion
  • Herramientas: ComfyUI, Forge, Civitai, Replicate, RunPod
  • Tecnicas de control: ControlNet, IP-Adapter, inpainting, upscaling
  • Hugging Face + LM Studio: model cards, licencias, calculo RAM/VRAM, formatos y quantizaciones
  • Caso real DeepSeek-V4 Pro/Flash: MoE, parametros totales/activos, FP4+FP8 mixed, 1M context, eval results y terminos explicados
  • Glosario de fichas de Hugging Face: base, instruct, adapter, LoRA, merge, safetensors, GGUF, gated, chat template
  • Benchmarks en model cards: EM, Pass@1, Resolved, Acc, F1, Elo/rating y setup de evaluacion
  • Metodologia para mantenerse actualizado sin comprar humo
  • Matriz de eleccion de modelos segun coste, privacidad, contexto, tools y riesgo
  • Mini-lab de Hugging Face para decidir si una model card sirve
  • Google Colab para probar experimentos, entender limitaciones, usar repos de referencia y entregar notebooks reproducibles
  • Checklist de experimentos buenos, eval interna y errores comunes
  • RAG, agentic RAG, GraphRAG, hybrid search, contextual retrieval
  • RAG semantico: RAG no es una ontologia, knowledge graph vs vector store, RDF/OWL/SPARQL vs embeddings y cuando usar enfoque vectorial, semantico o hibrido
  • Decision fine-tuning: cuando si, cuando no y cuando es mejor RAG/prompt/cambiar de modelo
  • Fine-tuning con LoRA/QLoRA (Unsloth, Axolotl)
  • Datos sinteticos, bases de datos vectoriales
  • Text-to-SQL, prompt caching, context window
  • API hello world, streaming (SSE)
  • Arquitectura de apps con LLM: retry, fallback, circuit breaker, model routing

Agentes y orquestacion (slides 182-229)

  • Cuando usar un agente y cuando un prompt
  • Bucle ReAct, Plan-and-Execute, Reflexion
  • Agente clasico vs moderno: estado/contexto, acciones/tools, precondiciones/schemas, planner/LLM y motor de inferencia
  • Arquitecturas documentadas en SVG: ReAct, ReWOO, Reflexion, manager/supervisor, handoffs y workflow critic
  • Memoria persistente: CLAUDE.md, Zep, MemGPT
  • Function calling (tool use) con ejemplo completo
  • Patrones: chaining, routing, paralelizacion, orchestrator-workers
  • Harness Engineering: entorno ejecutable del agente, capas de control, guias, sensores, plantilla operativa, reglas de mercado, metricas, safety, guardrails, trazas y ciclo de mejora
  • Orquestadores: LangGraph, CrewAI, Claude Agent SDK, Google ADK (Agent Development Kit), Mastra
  • Claude Code: rules, skills, hooks, MCPs, subagentes, plugins
  • Coding agents: Claude Code, Devin, OpenHands, Aider, Codex CLI
  • MCP: concepto (el "USB de la IA") + servidor minimo en TypeScript
  • Computer Use, Browser Use, A2A (Agent-to-Agent)
  • Human-in-the-loop: niveles de autonomia

Realidad de construir con IA (slides 230-256)

  • IDE web vs terminal, comparativa de coding assistants
  • Benchmarks: que miden, que no miden, SWE-bench, leaderboards y evals internas
  • SWE-bench: Full, Verified, Lite (534), Multilingual, Multimodal (100 dev / 500 test), % Resolved, contaminacion, SWE-bench Pro y coste por resolucion
  • Precios y cambios actuales en herramientas de coding: Claude Code, Cursor, Copilot y Windsurf
  • IA en CI/CD, seguridad (OWASP Top 10 for LLMs), guardrails
  • Testing adversarial, red teaming, prompt injection
  • EU AI Act: clasificacion por riesgo, calendario
  • Costes comparados por tokens: Claude, GPT, Qwen, DeepSeek, GLM/Z.AI, cache, thinking y región
  • Prompts como codigo: versionado, evals, A/B testing
  • Testing de codigo generado: mutation testing, property-based
  • Vibe coding con disciplina
  • Configurar Claude Code, OpenCode y Cursor como un pro
  • Agentes en produccion: lecciones aprendidas y el "agent tax"

Evals y medicion avanzada (slides 257-262)

  • Eval de RAG: retrieval, recall@k, MRR, nDCG, groundedness, answerability y abstencion
  • LLM-as-judge: rubricas, calibracion con humanos, evaluacion ciega, pares A/B y casos negativos
  • Eval de agentes: task success, tool success, coste, robustez, trazas y rollback
  • FinOps de IA: coste por tarea aceptada, routing barato/caro, cache, batch/flex y revision humana

Incertidumbre y decision (slides 263-273)

  • Calibracion: confidence vs probabilidad real, reliability diagrams, Expected Calibration Error (ECE), Brier score y log loss
  • Politicas de decision: umbrales, abstencion, revision humana y coste esperado
  • Conformal prediction en regresion y clasificacion: intervalos, conjuntos de clases y limites practicos
  • Incertidumbre en LLMs y RAG: retrieval score, groundedness, answerability, schemas, eval historica y rutas de escalado

Data-centric AI (slides 274-285)

  • Dataset como producto: owner, version, contrato, linaje, unidad de dato, target y ventana temporal
  • Calidad de etiquetas: ruido, desacuerdo, label delay, sesgo de proceso, guias de anotacion, gold set y adjudicacion
  • Tests de datos, leakage avanzado, drift, representatividad, active learning y weak supervision
  • Datasheets y dataset cards: composicion, recogida, anotacion, usos recomendados/no recomendados y riesgos

Causalidad y experimentacion (slides 286-296)

  • Correlacion vs causalidad, DAGs, confounders, colliders, ajuste y operador do(X)
  • Contrafactuales, A/B testing, ATE, guardrails, sample ratio mismatch, peeking, novelty effect e interferencia
  • Uplift modeling y treatment effect para decidir en quien una accion cambia realmente el resultado

Interpretabilidad practica (slides 297-307)

  • Interpretabilidad global, local y segmentada; feature importance interna y permutation importance
  • PDP, ICE, ALE, SHAP, LIME, contraejemplos y ejemplos similares, explicados con limites
  • Interpretabilidad no causal, error slicing y trazas de LLM/agentes para depurar comportamiento real

Refuerzo formal (slides 308-318)

  • Reinforcement Learning formal: agente, entorno, estado, accion, recompensa y politica
  • MDP: S, A, P, R, gamma, politica, retorno, descuento, V(s), Q(s,a) y ecuacion de Bellman
  • Exploration vs exploitation, bandits, reward hacking y conexion con RLHF, RLAIF, Constitutional AI, RFT y RLVR

Privacidad avanzada (slides 319-330)

  • PII, datos sensibles, secretos, quasi-identifiers, anonimizacion, pseudonimizacion y reidentificacion
  • Differential privacy: epsilon, delta, ruido, composicion, DP-SGD y evaluacion de privacidad
  • Federated learning, confidential computing, memorization, extraction attacks, RAG leakage, retencion y contratos

Producto y UX de IA (slides 331-335)

  • Disenar para incertidumbre: citas visibles, confianza accionable, abstencion y conflictos de fuentes
  • Aprobacion humana: preview, diff, confirmacion, permisos minimos, logs y rollback
  • Conversaciones recuperables: memoria visible/editable, limites, handoff a humano y recuperacion de errores

Operar IA en produccion (slides 336-344)

  • LLMOps: control plane, runtime, observabilidad, evals y gobernanza
  • Serving open weights con vLLM, SGLang, TensorRT-LLM, llama.cpp y Ollama
  • Escalado de inferencia: continuous batching, KV cache, prefix caching, speculative decoding y chunked prefill
  • Routing, fallback y budgets por tarea segun riesgo, coste y dificultad
  • EvalOps: offline evals, shadow runs, canary releases, release gates y rollback
  • DataOps para IA: linaje, PII, licencias, calidad del corpus y drift
  • Post-training avanzado: SFT, DPO, RLHF/RLAIF, Constitutional AI, RFT con graders y RL verificable/RLVR

Seguridad, gobernanza y confianza (slides 345-351)

  • Seguridad agentic: tools, MCP, permisos minimos, threat modeling, confused deputy, tool poisoning y exfiltracion
  • OWASP LLM Top 10 aplicado a controles, CI y datasets adversariales
  • Privacidad y private AI: API publica, VPC (Virtual Private Cloud), on-prem, despliegue hibrido, retencion y region
  • Gobernanza: EU AI Act, NIST AI RMF, NIST GenAI Profile e ISO/IEC 42001
  • Interpretabilidad: mechanistic interpretability, sparse autoencoders, features y limites de confianza

Modelos open weights con Ollama Cloud (slides 352-358)

  • Ollama Cloud: modelos open weights sin GPU
  • Catalogo, setup, integracion con herramientas
  • Cloud vs local: cuando usar cada uno

Laboratorios IA aplicada (slides 359-371)

  • A* con un problema pequeno y comparacion de coste, heuristica y nodos expandidos
  • Mini planner: tareas como estados, acciones, precondiciones y efectos
  • Clasificador simple con scikit-learn, train/test y matriz de confusion
  • K-means visual y criterios para no confiar en clusters
  • Ontologia pequena + SPARQL conectada con GraphRAG y RAG hibrido
  • Comparativa de una misma tarea con reglas, RAG y agente LLM

Ingenieria avanzada de IA aplicada (slides 372-399)

  • Agent Workbench: instrucciones, estado, scope, tools, feedback, verificacion y handoff
  • Workbench minimo: AGENTS.md, agent_state.json, task_board.json y trazas operativas
  • RAG multimodal y vision-native RAG: PDFs visuales, ColPali, late interaction, MaxSim y coste de almacenamiento
  • Retrieval cross-modal: texto, imagen, audio, video, fusion de senales y grounding verificable
  • Computer-use: GUI grounding, action schemas, screenshots, DOM, accessibility tree y benchmarks
  • Load testing LLM: TTFT, TPOT, ITL, goodput, P95/P99, distribucion realista de prompts y patrones steady/ramp/spike/soak
  • Red-team tooling: campanas repetibles, Llama Guard, Garak, PyRIT, scoring y regresion de seguridad
  • Labs Build It / Use It / Ship It: workbench minimo, RAG multimodal y prueba de carga/red-team

Algoritmia para la toma de decisiones (slides 400-429)

  • Decision puntual vs secuencial: estado, accion, observacion, recompensa, utilidad y coste esperado
  • Utilidad esperada, riesgo esperado, valor de la informacion, incertidumbre aleatoria/epistemica/de estado y politicas
  • MDP: S, A, T, R, gamma, retorno, V(s), Q(s,a), Bellman, dynamic programming, value iteration y policy iteration
  • Online planning, MCTS/UCT, bandits, exploration vs exploitation, model-based vs model-free
  • POMDPs, belief state, actualizacion bayesiana, multiagente, equilibrio, validacion de politicas, rare events y agentes LLM como sistemas de decision

Recursos y siguiente paso (slides 430-438 + cierre)

  • Recursos finales ampliados: mapa de estudio, papers, benchmarks, laboratorio practico, glosario en dos partes, checklist de exactitud, pipeline de entrega, contaminacion de benchmarks y ruta de 30 dias

Las secciones principales incluyen slides de recapitulacion con referencias cruzadas; el bloque final añade laboratorios, ingenieria avanzada, decision algoritmica, recursos, glosario ampliado, checklist de exactitud y ruta de 30 dias.

Arrancar en local

git clone https://github.com/686f6c61/Workshop-IA-Agentes-Herramientas.git
cd Workshop-IA-Agentes-Herramientas
npm install
npm run dev

Build y deploy

npm run build    # genera dist/
npm run preview  # preview local del build

Deploy automatico en Coolify usando el Dockerfile. Cada push a main redespliega el servicio conectado al repo. El render.yaml se mantiene como configuracion estatica alternativa para Render.

Stack

  • Astro 6 (static site)
  • Lucide Icons (CDN)
  • Space Grotesk + IBM Plex Mono
  • Google Analytics + Search Console
  • Coolify en VPS (Docker + nginx)

Autor

686f6c61

Licencia

MIT

About

Workshop de IA: agentes, modelos y herramientas

Resources

Stars

40 stars

Watchers

0 watching

Forks

Contributors

Languages