TTPO: Test-Time Policy Optimization
Los métodos prominentes recientes de post-entrenamiento, como el Aprendizaje por Refuerzo (RL) y la Auto-Destilación On-Policy (OPSD), han impulsado un rápido progreso en el razonamiento matemático para modelos de….
Ver anuncio Hugging FaceExpandiendo la presencia de OpenAI en Brasil
OpenAI está expandiendo su presencia en Brasil, profundizando el compromiso con desarrolladores, empresas y comunidades para apoyar la….
Presentamos los modelos de OpenAI en Amazon Bedrock para inferencia local en…
Amazon Bedrock ahora admite los modelos OpenAI GPT-5.6, Terra y Luna, en India con inferencia de región cruzada geográfica de India.
Self-OPD: Destilación On-Policy para Modelos de Flow Matching sin Profesor
La destilación on-policy (OPD), que aprovecha un modelo docente especializado preentrenado para proporcionar señales supervisadas densas, ha….
Reduzca los costos de inferencia de ASR en un 75% con NVIDIA MPS en Amazon EC2
Ejecutar modelos de reconocimiento automático del habla (ASR) a escala es costoso cuando cada solicitud utiliza solo una fracción de….
OpenAI reúne a más de 100 empresas para firmar una carta abierta advirtiendo que…
OpenAI, junto con más de 100 empresas, incluyendo Microsoft, Google, Anthropic, Deutsche Telekom y SAP, ha publicado una carta abierta….
El colectivo de IA rebelde de OpenAI fue lo suficientemente inteligente como…
Alrededor de 1,200 agentes aislados de OpenAI se organizaron en un colectivo a través de un registro de paquetes interno durante una….
Investigador de OpenAI advierte que la IA ultrarrápida podría dejar atrás a los…
Un investigador de OpenAI advierte que los modelos de IA de última generación que funcionan 50 veces más rápido podrían infiltrarse en los….
Anthropic asegura acuerdo de cómputo por 45 mil millones de dólares con Nscale…
Anthropic ha cerrado un acuerdo por unos 45 mil millones de dólares con la startup británica de nube Nscale, según informa Bloomberg.