OpenAI Frontier: plataforma empresarial para orquestar agentes con permisos
OpenAI presentó Frontier como una plataforma para empresas que construyen, despliegan y gestionan agentes con identidad, contexto, permisos explícitos y guardrails, enfocada en pasar de PoCs a producción. La disponibilidad inicia limitada, con expansión en los próximos meses.
Ver anuncio OpenAIGPT-5.3-Codex: modelo de coding agentic ~25% más rápido
OpenAI lanza GPT-5.3-Codex, su modelo más capaz para coding agentic, con mejoras de infraestructura que prometen ~25% más velocidad en Codex.
Claude Opus 4.6: 1M contexto (beta) y pricing público
Anthropic actualiza Opus 4.6 con ventana de contexto de 1M tokens en beta, ‘agent teams’ y precios detallados para uso en web y API.
Perplexity Model Council: investigación multi-modelo con ‘chair model’
Model Council ejecuta tu pregunta en Claude, GPT y Gemini, y una ‘chair model’ sintetiza consenso y desacuerdos para reducir sesgos de un solo modelo.
‘Software-mageddon’: selloff borra hasta ~US$1T en software y data
La caída del S&P 500 Software & Services ya acumula ~US$830B–1T desde el 28-Ene, por miedo a disrupción de agentes.
Gemma-SEA-LION-v4-4B-VL: VLM regional 128k con tool calling
AI Singapore publica un VLM de 4B basado en Gemma-3, con 128k de contexto y tool calling, adaptado a idiomas del Sudeste Asiático.
pydantic-ai v1.56.0 añade soporte para Claude Opus 4.6
pydantic-ai v1.56.0 incorpora soporte para Claude Opus 4.6 y nuevos parámetros, acelerando la integración de agentes Python con tipado y observabilidad.
Meta prueba app independiente para Vibes (video 100% generado por IA)
Meta prueba separar Vibes en una app propia para videos cortos generados por IA, con plan freemium y posibles suscripciones en meses.
Google Cloud y U.S. Ski: motion capture 3D desde video de smartphone
Google Cloud y U.S. Ski trabajan en una herramienta que convierte video de smartphone en motion capture 3D, con IA de DeepMind.
Laravel AI SDK (beta): agentes, structured output y failover multi-proveedor
Laravel presenta un SDK beta que unifica proveedores, agents y structured output, e incluye failover automático para aplicaciones PHP en producción.
ContextBench (arXiv): benchmark de recuperación de contexto para coding agents
ContextBench propone un benchmark process-oriented para medir cómo los coding agents recuperan contexto en repos reales, con 1,136 tareas y gold contexts.
Empirical-MCTS: evolución continua de agentes con MCTS de doble memoria
Empirical-MCTS combina búsqueda tipo MCTS con memoria dual y meta-prompts que evolucionan en tiempo real, mejorando agentes sin reentrenar sus pesos.
GOPO: optimización de políticas con ranked rewards para RLHF más eficiente
GOPO transforma recompensas en rankings para optimización de políticas y reporta mejor sample-efficiency que GRPO en tareas de lenguaje no verificables y alineamiento.