De la neurona al agente: portada, 438 slides numeradas y cierre para entender la IA moderna y aplicarla con criterio en tu dia a dia. Desde backpropagation, busqueda heuristica, planning, SAT/CSP, ML clasico, complejidad temporal, incertidumbre, causalidad, interpretabilidad, refuerzo formal, privacidad avanzada, algoritmia para la toma de decisiones y ontologias hasta desplegar agentes en produccion, pasando por Transformers por dentro, RAG, RAG multimodal, fine-tuning, MCP, ControlNet, Hugging Face, Google Colab, evals avanzadas, Agent Workbench, computer-use, load testing LLM, red-team tooling, UX de IA, LLMOps, seguridad agentic, gobernanza, modelos open weights y vibe coding.
Ver presentacion | Actualizado a mayo 2026 (update 05/26)
- Que es (y que no es) la IA
- Determinismo vs sistemas estocasticos
- La neurona artificial, redes neuronales, backpropagation, regla de la cadena, símbolos y ejemplo numérico con gradientes
- Funciones de perdida, optimizadores (Adam, SGD)
- CNNs para vision, RNNs y LSTMs para secuencias
- Tokens, embeddings, similitud coseno
- Entrenamiento vs inferencia, quantizacion (GGUF, bitsandbytes, GPTQ = GPT Quantization, AWQ = Activation-aware Weight Quantization, Q4-Q8)
- ML clasico esencial: dataset, features, labels, train/test, overfitting y validacion
- Supervisado vs no supervisado vs refuerzo; clasificacion vs regresion
- Complejidad temporal en ML: Big-O, entrenamiento vs inferencia y coste por algoritmo
- Matriz de confusion, precision, recall, F1 y clustering/k-means
- Busqueda en espacios de estados: BFS, DFS, coste uniforme, greedy, A* y heuristicas admisibles
- SAT y CSP: variables, dominios, restricciones, propagacion, backtracking y heuristicas
- Planificacion automatica: estados, acciones, precondiciones, efectos, PDDL y planificacion heuristica
- IA en juegos: minimax, poda alpha-beta, funciones de evaluacion, Monte Carlo y MCTS
- Conocimiento simbolico: RDF, RDFS, OWL, SPARQL, Linked Data, ontologias y sistemas expertos
- Puente practico entre IA clasica, agentes LLM, RAG, GraphRAG y validadores modernos
- LLMs, Transformers, Mixture of Experts, SSM (State Space Model)/Mamba, RWKV/RetNet, Hyena, Jamba y arquitecturas byte/latent
- Dimensiones de modelos: parametros totales/activos, capas, hidden size, heads, context window
- Estado del arte mayo 2026: GPT-5.5/5.4, Claude Opus 4.7, Gemini 3.1 Pro Preview (
gemini-3.1-pro-preview), gpt-oss, Qwen3.6, DeepSeek-V4, Llama 4 y Mistral 3 - Atencion en detalle: matrices Q, K, V, multi-head, RoPE
- Tokenizacion en profundidad: BPE (Byte Pair Encoding), WordPiece, SentencePiece
- Transformer Explainer como laboratorio visual: texto a tensores, embeddings, QKV, mascara causal, softmax, MLP, residual, LayerNorm, logits y sampling
- Transfer learning: de ImageNet a GPT
- Modelos multimodales nativos (texto + imagen + audio + video)
- Parametros: temperature, top_p, top_k
- Modelos de razonamiento (thinking tokens)
- Open weights vs propietario, destilacion, inferencia optimizada
- Edge AI: modelos en navegador, movil e IoT
- Prompt engineering y context engineering
- Alucinaciones y como protegerte
- Structured output / JSON mode con schema
- Vision, multimodalidad, voz en tiempo real (OpenAI Realtime, ElevenLabs)
- Generacion de imagenes: difusion, latent space, CFG
- Entrenamiento de imagen: LoRA, DreamBooth, Textual Inversion
- Herramientas: ComfyUI, Forge, Civitai, Replicate, RunPod
- Tecnicas de control: ControlNet, IP-Adapter, inpainting, upscaling
- Hugging Face + LM Studio: model cards, licencias, calculo RAM/VRAM, formatos y quantizaciones
- Caso real DeepSeek-V4 Pro/Flash: MoE, parametros totales/activos, FP4+FP8 mixed, 1M context, eval results y terminos explicados
- Glosario de fichas de Hugging Face: base, instruct, adapter, LoRA, merge, safetensors, GGUF, gated, chat template
- Benchmarks en model cards: EM, Pass@1, Resolved, Acc, F1, Elo/rating y setup de evaluacion
- Metodologia para mantenerse actualizado sin comprar humo
- Matriz de eleccion de modelos segun coste, privacidad, contexto, tools y riesgo
- Mini-lab de Hugging Face para decidir si una model card sirve
- Google Colab para probar experimentos, entender limitaciones, usar repos de referencia y entregar notebooks reproducibles
- Checklist de experimentos buenos, eval interna y errores comunes
- RAG, agentic RAG, GraphRAG, hybrid search, contextual retrieval
- RAG semantico: RAG no es una ontologia, knowledge graph vs vector store, RDF/OWL/SPARQL vs embeddings y cuando usar enfoque vectorial, semantico o hibrido
- Decision fine-tuning: cuando si, cuando no y cuando es mejor RAG/prompt/cambiar de modelo
- Fine-tuning con LoRA/QLoRA (Unsloth, Axolotl)
- Datos sinteticos, bases de datos vectoriales
- Text-to-SQL, prompt caching, context window
- API hello world, streaming (SSE)
- Arquitectura de apps con LLM: retry, fallback, circuit breaker, model routing
- Cuando usar un agente y cuando un prompt
- Bucle ReAct, Plan-and-Execute, Reflexion
- Agente clasico vs moderno: estado/contexto, acciones/tools, precondiciones/schemas, planner/LLM y motor de inferencia
- Arquitecturas documentadas en SVG: ReAct, ReWOO, Reflexion, manager/supervisor, handoffs y workflow critic
- Memoria persistente: CLAUDE.md, Zep, MemGPT
- Function calling (tool use) con ejemplo completo
- Patrones: chaining, routing, paralelizacion, orchestrator-workers
- Harness Engineering: entorno ejecutable del agente, capas de control, guias, sensores, plantilla operativa, reglas de mercado, metricas, safety, guardrails, trazas y ciclo de mejora
- Orquestadores: LangGraph, CrewAI, Claude Agent SDK, Google ADK (Agent Development Kit), Mastra
- Claude Code: rules, skills, hooks, MCPs, subagentes, plugins
- Coding agents: Claude Code, Devin, OpenHands, Aider, Codex CLI
- MCP: concepto (el "USB de la IA") + servidor minimo en TypeScript
- Computer Use, Browser Use, A2A (Agent-to-Agent)
- Human-in-the-loop: niveles de autonomia
- IDE web vs terminal, comparativa de coding assistants
- Benchmarks: que miden, que no miden, SWE-bench, leaderboards y evals internas
- SWE-bench: Full, Verified, Lite (534), Multilingual, Multimodal (100 dev / 500 test), % Resolved, contaminacion, SWE-bench Pro y coste por resolucion
- Precios y cambios actuales en herramientas de coding: Claude Code, Cursor, Copilot y Windsurf
- IA en CI/CD, seguridad (OWASP Top 10 for LLMs), guardrails
- Testing adversarial, red teaming, prompt injection
- EU AI Act: clasificacion por riesgo, calendario
- Costes comparados por tokens: Claude, GPT, Qwen, DeepSeek, GLM/Z.AI, cache, thinking y región
- Prompts como codigo: versionado, evals, A/B testing
- Testing de codigo generado: mutation testing, property-based
- Vibe coding con disciplina
- Configurar Claude Code, OpenCode y Cursor como un pro
- Agentes en produccion: lecciones aprendidas y el "agent tax"
- Eval de RAG: retrieval, recall@k, MRR, nDCG, groundedness, answerability y abstencion
- LLM-as-judge: rubricas, calibracion con humanos, evaluacion ciega, pares A/B y casos negativos
- Eval de agentes: task success, tool success, coste, robustez, trazas y rollback
- FinOps de IA: coste por tarea aceptada, routing barato/caro, cache, batch/flex y revision humana
- Calibracion: confidence vs probabilidad real, reliability diagrams, Expected Calibration Error (ECE), Brier score y log loss
- Politicas de decision: umbrales, abstencion, revision humana y coste esperado
- Conformal prediction en regresion y clasificacion: intervalos, conjuntos de clases y limites practicos
- Incertidumbre en LLMs y RAG: retrieval score, groundedness, answerability, schemas, eval historica y rutas de escalado
- Dataset como producto: owner, version, contrato, linaje, unidad de dato, target y ventana temporal
- Calidad de etiquetas: ruido, desacuerdo, label delay, sesgo de proceso, guias de anotacion, gold set y adjudicacion
- Tests de datos, leakage avanzado, drift, representatividad, active learning y weak supervision
- Datasheets y dataset cards: composicion, recogida, anotacion, usos recomendados/no recomendados y riesgos
- Correlacion vs causalidad, DAGs, confounders, colliders, ajuste y operador do(X)
- Contrafactuales, A/B testing, ATE, guardrails, sample ratio mismatch, peeking, novelty effect e interferencia
- Uplift modeling y treatment effect para decidir en quien una accion cambia realmente el resultado
- Interpretabilidad global, local y segmentada; feature importance interna y permutation importance
- PDP, ICE, ALE, SHAP, LIME, contraejemplos y ejemplos similares, explicados con limites
- Interpretabilidad no causal, error slicing y trazas de LLM/agentes para depurar comportamiento real
- Reinforcement Learning formal: agente, entorno, estado, accion, recompensa y politica
- MDP: S, A, P, R, gamma, politica, retorno, descuento, V(s), Q(s,a) y ecuacion de Bellman
- Exploration vs exploitation, bandits, reward hacking y conexion con RLHF, RLAIF, Constitutional AI, RFT y RLVR
- PII, datos sensibles, secretos, quasi-identifiers, anonimizacion, pseudonimizacion y reidentificacion
- Differential privacy: epsilon, delta, ruido, composicion, DP-SGD y evaluacion de privacidad
- Federated learning, confidential computing, memorization, extraction attacks, RAG leakage, retencion y contratos
- Disenar para incertidumbre: citas visibles, confianza accionable, abstencion y conflictos de fuentes
- Aprobacion humana: preview, diff, confirmacion, permisos minimos, logs y rollback
- Conversaciones recuperables: memoria visible/editable, limites, handoff a humano y recuperacion de errores
- LLMOps: control plane, runtime, observabilidad, evals y gobernanza
- Serving open weights con vLLM, SGLang, TensorRT-LLM, llama.cpp y Ollama
- Escalado de inferencia: continuous batching, KV cache, prefix caching, speculative decoding y chunked prefill
- Routing, fallback y budgets por tarea segun riesgo, coste y dificultad
- EvalOps: offline evals, shadow runs, canary releases, release gates y rollback
- DataOps para IA: linaje, PII, licencias, calidad del corpus y drift
- Post-training avanzado: SFT, DPO, RLHF/RLAIF, Constitutional AI, RFT con graders y RL verificable/RLVR
- Seguridad agentic: tools, MCP, permisos minimos, threat modeling, confused deputy, tool poisoning y exfiltracion
- OWASP LLM Top 10 aplicado a controles, CI y datasets adversariales
- Privacidad y private AI: API publica, VPC (Virtual Private Cloud), on-prem, despliegue hibrido, retencion y region
- Gobernanza: EU AI Act, NIST AI RMF, NIST GenAI Profile e ISO/IEC 42001
- Interpretabilidad: mechanistic interpretability, sparse autoencoders, features y limites de confianza
- Ollama Cloud: modelos open weights sin GPU
- Catalogo, setup, integracion con herramientas
- Cloud vs local: cuando usar cada uno
- A* con un problema pequeno y comparacion de coste, heuristica y nodos expandidos
- Mini planner: tareas como estados, acciones, precondiciones y efectos
- Clasificador simple con scikit-learn, train/test y matriz de confusion
- K-means visual y criterios para no confiar en clusters
- Ontologia pequena + SPARQL conectada con GraphRAG y RAG hibrido
- Comparativa de una misma tarea con reglas, RAG y agente LLM
- Agent Workbench: instrucciones, estado, scope, tools, feedback, verificacion y handoff
- Workbench minimo: AGENTS.md, agent_state.json, task_board.json y trazas operativas
- RAG multimodal y vision-native RAG: PDFs visuales, ColPali, late interaction, MaxSim y coste de almacenamiento
- Retrieval cross-modal: texto, imagen, audio, video, fusion de senales y grounding verificable
- Computer-use: GUI grounding, action schemas, screenshots, DOM, accessibility tree y benchmarks
- Load testing LLM: TTFT, TPOT, ITL, goodput, P95/P99, distribucion realista de prompts y patrones steady/ramp/spike/soak
- Red-team tooling: campanas repetibles, Llama Guard, Garak, PyRIT, scoring y regresion de seguridad
- Labs Build It / Use It / Ship It: workbench minimo, RAG multimodal y prueba de carga/red-team
- Decision puntual vs secuencial: estado, accion, observacion, recompensa, utilidad y coste esperado
- Utilidad esperada, riesgo esperado, valor de la informacion, incertidumbre aleatoria/epistemica/de estado y politicas
- MDP: S, A, T, R, gamma, retorno, V(s), Q(s,a), Bellman, dynamic programming, value iteration y policy iteration
- Online planning, MCTS/UCT, bandits, exploration vs exploitation, model-based vs model-free
- POMDPs, belief state, actualizacion bayesiana, multiagente, equilibrio, validacion de politicas, rare events y agentes LLM como sistemas de decision
- Recursos finales ampliados: mapa de estudio, papers, benchmarks, laboratorio practico, glosario en dos partes, checklist de exactitud, pipeline de entrega, contaminacion de benchmarks y ruta de 30 dias
Las secciones principales incluyen slides de recapitulacion con referencias cruzadas; el bloque final añade laboratorios, ingenieria avanzada, decision algoritmica, recursos, glosario ampliado, checklist de exactitud y ruta de 30 dias.
git clone https://github.com/686f6c61/Workshop-IA-Agentes-Herramientas.git
cd Workshop-IA-Agentes-Herramientas
npm install
npm run devnpm run build # genera dist/
npm run preview # preview local del buildDeploy automatico en Coolify usando el Dockerfile. Cada push a main redespliega el servicio conectado al repo. El render.yaml se mantiene como configuracion estatica alternativa para Render.
- Astro 6 (static site)
- Lucide Icons (CDN)
- Space Grotesk + IBM Plex Mono
- Google Analytics + Search Console
- Coolify en VPS (Docker + nginx)
MIT