
#OpenAIInferenceCostTest
About OpenAIInferenceCostTest
OpenAI shared early tests of Jalapeño, its first in-house inference chip. It says it delivers 1.5x-1.9x more throughput per watt on open models and cuts end-to-end latency by 1.7x-3.6x. Deployment is planned by year-end, with two successors in development. It also says GPT-5.6 Sol used 54% fewer output tokens than a leading rival on coding tasks. After $6.7B in Q2 revenue and a $12.3B operating loss, can these company-tested gains lower inference costs, narrow losses and support its IPO valuatio
Populares
Más recientes
OpenAIInferenceCostTest Publicaciones populares
#OpenAIQ2LossWidens
Las empresas de rápido crecimiento no siempre se convierten en grandes negocios.
OpenAI sigue creciendo, pero las pérdidas también. Anthropic está tomando un camino diferente al mostrar primeros signos de rentabilidad. Los ingresos acaparan titulares.
La economía sostenible suele decidir quién gana el maratón. ¿Qué te importa más hoy, el crecimiento o la rentabilidad?

RECIÉN LLEGADO: Probabilidades de salida a bolsa de Anthropic por encima del aumento de valoración de $SPCX billones de dólares de SpaceX.

Todo el enfoque en torno a Jalapeño parece centrado en el rendimiento respecto a Nvidia, pero la velocidad de ingeniería detrás de él es realmente notable. Algunos aspectos destacados de la charla @hotchipsorg:
1. Construir chips personalizados solía requerir ejércitos masivos de ingenieros y plazos de varios años. OpenAI pasó de código RTL inicial a cinta en solo 9 meses usando XLS (un lenguaje similar a Rust para hardware de Google) y co-diseño impulsado por IA.
2. Un bucle de IA tomó un núcleo bruto y apenas funcional (DeepSeek) que funcionaba con una eficiencia del 0,31% y lo optimizó de forma autónoma hasta el 88,94% del límite físico del chip en menos de 2 días.
3. El código generado por IA se ejecutaba hasta 1,8 veces más rápido en bloques críticos que las implementaciones ajustadas a mano por ingenieros de kernel de primer nivel.
4. La IA hacía más que escribir software para el chip. Optimizaba los circuitos físicos de hardware antes de la tapeout.
De nuevo, esto no es suma cero ni un negativo neto para Nvidia. Los ASICs personalizados desbloquean eficiencias absurdas en el servicio para cargas de trabajo especializadas y ampliarán el pastel total de cómputo para toda la industria.
Desde que anunciamos Jalapeño, nuestro primer chip de inferencia personalizado, lo hemos estado probando junto con el sistema que lo rodea.
Los resultados muestran un gran avance: más inteligencia de cada vatio y respuestas más rápidas, ofreciendo tanto mayor rendimiento como menor latencia en una sola arquitectura sin sacrificar eficiencia.

OpenAI afirma que su nuevo chip de IA Jalapeño podría reducir significativamente el coste de ejecutar inteligencia artificial, pero Jim Cramer (@jimcramer) sigue siendo escéptico respecto a que suponga una amenaza seria para Nvidia ($NVDA).
Jalapeño es el primer chip de inferencia personalizada de OpenAI y fue desarrollado junto con Broadcom ($AVGO). La compañía planea comenzar a desplegarlo internamente a finales de 2026, con la producción prevista para aumentar aún más en 2027.
El CEO de OpenAI, Sam Altman (@sama), describió el chip simplemente diciendo: "Hemos creado un chip y es rápido." La compañía ya está trabajando en versiones de segunda y tercera generación.
OpenAI afirma que Jalapeño puede ofrecer tanto mayor rendimiento como menor latencia, una combinación difícil de lograr. Sus benchmarks internos mostraron un mejor rendimiento por vatio que los sistemas GB200 y GB300 de Nvidia en varios modelos de IA grandes.
Dependiendo de la carga de trabajo, OpenAI afirma que Jalapeño ofreció aproximadamente entre 1,5 y 1,9 veces más rendimiento por vatio y una latencia significativamente menor. El chip está diseñado específicamente para inferencia en lugar de entrenamiento por IA.
Richard Ho, ejecutivo de hardware de OpenAI, afirmó que esas mejoras en eficiencia podrían traducirse eventualmente en precios más bajos para los tokens para los clientes a medida que el chip entre en producción.
Aun así, OpenAI no planea reemplazar completamente a Nvidia. La compañía dijo que seguirá utilizando aceleradores y hardware de Nvidia de otros socios tanto para entrenamiento como para inferencia.
Cramer descartó la idea de que cada nuevo chip de IA represente un rival significativo de Nvidia. Dijo que suele escuchar afirmaciones sobre chips superiores, pero sigue viendo "ningún competidor real" para Nvidia a gran escala.


Jalapeño de OpenAI es una señal de que la industria de la IA está entrando en la era del "posee la pila".
El manual de jugadas solía ser mantenerte en tu carril y centrarte.
Las empresas modelo entrenaban modelos. Las empresas de chips fabricaban chips. Las empresas de datos recogían datos.
Esa era ha terminado.
OpenAI empezó como un laboratorio puramente de modelos. Ahora diseñan silicio personalizado y optimizan los sistemas completos en función de sus cargas de trabajo reales.
Esta semana también vimos cómo @Figure_robot pasando a la capa de datos y lanzando Index, sus propios esfuerzos de recopilación de datos que abarcan 108 países.
Todo el mundo sube y baja en la pila.
Parte probablemente sea para profundizar fosos estrechos, parte para reducir costes y otra parte para justificar valoraciones.

OpenAI construyó un chip de inferencia personalizado (Jalapeño) y pasó de ser el primer RTL a la tapeout en 9 meses.
Cuando diseñaba y tapeaba SoCs complejos, 18–24 meses desde RTL hasta el tapeout era normal. La verificación y el diseño físico consumían la mayor parte de ese calendario.
La IA que escribe Verilog/VHDL es algo esperado con todos los agentes de programación. La parte impresionante fue... @OpenAI equipo usó un modelo interno con retroalimentación rápida de QoR y verificación robusta para optimizar el RTL
La IA está comprimiendo mucho el ciclo de diseño... Bien para todos. Veríamos más silicio e innovación. Ahora la diferenciación se traslada a asegurar la capacidad de TSMC y la asignación de HBM...
Se pueden diseñar más chips... pero se pueden producir menos a gran escala.



OpenAI se está tomando en serio la adquisición de toda la pila de IA
Jalapeño por fin está pasando de las pruebas a la infraestructura de OpenAI
> más trabajo de IA con cada vatio
> mayor rendimiento con menor latencia
> respuestas más rápidas de ChatGPT y Codex
esto es solo la Gen 1, la Gen 2 ya está en desarrollo, mientras que la Gen 3 está tomando forma.
OpenAI ya tiene los modelos, los usuarios y la demanda.
Ahora también está construyendo el cómputo debajo de ellos.
La verdadera pregunta es hasta dónde llega esto cuando Jalapeño empieza a escalar su infraestructura.
¿Cómo crees que será la Generación 2?


Desde que anunciamos Jalapeño, nuestro primer chip de inferencia personalizado, lo hemos estado probando junto con el sistema que lo rodea.
Los resultados muestran un gran avance: más inteligencia de cada vatio y respuestas más rápidas, ofreciendo tanto mayor rendimiento como menor latencia en una sola arquitectura sin sacrificar eficiencia.
Las primeras pruebas Jalapeño de OpenAI apuntan a un cambio potencialmente significativo en la economía de la inferencia: 1,5x-1,9x más rendimiento por vatio y 1,7x-3,6x menor latencia de extremo a extremo en modelos abiertos. GPT-5.6 Sol también utilizó supuestamente un 54% menos de tokens de salida que un rival líder en tareas de codificación.
El juicio medido es que las ganancias de eficiencia podrían mejorar la economía unitaria, pero los índices de referencia probados por la empresa aún no son prueba de menores costes agregados. Con 6.700 millones de dólares en ingresos del segundo trimestre frente a una pérdida operativa de 12.300 millones de dólares, el despliegue a gran escala y el crecimiento de la carga de trabajo importarán más que el rendimiento general. No es consejo, solo análisis.
#OpenAIInferenceCostTest

El primer chip de inferencia personalizado de OpenAI ofrece mayor rendimiento, menor latencia y mejor eficiencia en una sola arquitectura.
Cuando el mayor laboratorio de IA empieza a diseñar su propio silicio, la economía de la inferencia a gran escala tiene un problema.
La capa de cómputo se está reconstruyendo desde cero.
Desde que anunciamos Jalapeño, nuestro primer chip de inferencia personalizado, lo hemos estado probando junto con el sistema que lo rodea.
Los resultados muestran un gran avance: más inteligencia de cada vatio y respuestas más rápidas, ofreciendo tanto mayor rendimiento como menor latencia en una sola arquitectura sin sacrificar eficiencia.


