
#OpenAIInferenceCostTest
About OpenAIInferenceCostTest
OpenAI shared early tests of Jalapeño, its first in-house inference chip. It says it delivers 1.5x-1.9x more throughput per watt on open models and cuts end-to-end latency by 1.7x-3.6x. Deployment is planned by year-end, with two successors in development. It also says GPT-5.6 Sol used 54% fewer output tokens than a leading rival on coding tasks. After $6.7B in Q2 revenue and a $12.3B operating loss, can these company-tested gains lower inference costs, narrow losses and support its IPO valuatio
Populares
Mais recentes
OpenAIInferenceCostTest Publicações populares
#OpenAIQ2LossWidens
Empresas que crescem rápido nem sempre se tornam grandes negócios.
A OpenAI continua crescendo, mas as perdas também estão crescendo. A Anthropic está seguindo um caminho diferente ao mostrar sinais iniciais de lucratividade. Receita ganha manchetes.
A economia sustentável geralmente decide quem vence a maratona. O que importa mais para você hoje, crescimento ou lucratividade?

RECENTEMENTE CHEGADO: Chances de IPO da Anthropic acima do aumento de avaliação de $SPCX US$ 1,77 trilhão da SpaceX.

Todo o foco em torno do Jalapeño parece estar centrado no desempenho em relação à Nvidia, mas a velocidade de engenharia por trás dele é realmente notável. Alguns destaques da palestra @hotchipsorg:
1. Construir chips personalizados costumava exigir exércitos massivos de engenheiros e prazos de vários anos. A OpenAI passou do código RTL inicial para o tapeout em apenas 9 meses usando XLS (uma linguagem semelhante à Rust para hardwares do Google) e co-design impulsionado por IA.
2. Um ciclo de IA pegou um kernel bruto e quase infuncional (DeepSeek) rodando com 0,31% de eficiência e o otimizou autonomamente para 88,94% do limite físico do chip em menos de 2 dias.
3. O código gerado por IA rodava até 1,8x mais rápido em blocos críticos do que implementações ajustadas manualmente por engenheiros de kernel de classe mundial.
4. A IA fazia mais do que apenas escrever software para o chip. Otimizava os circuitos físicos de hardware antes da tapeout.
Novamente, isso não é soma zero nem um saldo negativo para a Nvidia. ASICs personalizados desbloqueiam eficiências absurdas de serviço para cargas de trabalho especializadas e expandirão o total de computação para toda a indústria.
Desde que anunciamos o Jalapeño, nosso primeiro chip de inferência personalizado, temos testado ele e o sistema ao seu redor.
Os resultados mostram um grande avanço: mais inteligência a cada watt e respostas mais rápidas, entregando tanto maior taxa de transferência quanto menor latência em uma única arquitetura, sem sacrificar eficiência.

A OpenAI afirma que seu novo chip de IA Jalapeño pode reduzir significativamente o custo de rodar inteligência artificial, mas Jim Cramer (@jimcramer) permanece cético quanto a sua ameaça séria para a Nvidia ($NVDA).
Jalapeño é o primeiro chip de inferência personalizado da OpenAI e foi desenvolvido com a Broadcom ($AVGO). A empresa planeja começar a implantá-la internamente até o final de 2026, com a produção prevista para aumentar ainda mais em 2027.
O CEO da OpenAI, Sam Altman (@sama), descreveu o chip simplesmente dizendo: "Nós fizemos um chip e ele é rápido." A empresa já está trabalhando em versões de segunda e terceira geração.
A OpenAI afirma que o Jalapeño pode entregar tanto maior taxa quanto menor latência, uma combinação difícil de alcançar. Seus benchmarks internos mostraram desempenho por watt melhor do que os sistemas GB200 e GB300 da Nvidia em vários grandes modelos de IA.
Dependendo da carga de trabalho, a OpenAI afirma que o Jalapeño entregou aproximadamente 1,5x a 1,9x mais desempenho por watt e latência significativamente menor. O chip foi projetado especificamente para inferência, e não para treinamento de IA.
O executivo de hardware da OpenAI, Richard Ho, disse que esses ganhos de eficiência poderiam, eventualmente, se traduzir em preços mais baixos dos tokens para os clientes à medida que o chip avança para a produção.
Ainda assim, a OpenAI não planeja substituir totalmente a Nvidia. A empresa afirmou que continuará utilizando aceleradores Nvidia e hardware de outros parceiros tanto para treinamento quanto para inferência.
Cramer descartou a ideia de que cada novo chip de IA representa um desafiante significativo da Nvidia. Ele disse que ouve regularmente alegações sobre chips superiores, mas continua vendo "nenhum concorrente real" para a Nvidia em grande escala.


Jalapeño, da OpenAI, é um sinal de que a indústria de IA está entrando na era do "possuir a pilha".
O manual costumava ser ficar na sua rota e focar.
Empresas de modelos treinavam modelos. As empresas de chips fabricavam chips. Empresas de dados coletaram dados.
Essa era acabou.
A OpenAI começou como um laboratório puramente modelista. Agora eles estão projetando silício personalizado e otimizando todos os sistemas de acordo com suas cargas de trabalho reais.
Esta semana também vimos @Figure_robot migrando para a camada de dados e lançando o Index, seus próprios esforços de coleta de dados que abrangem 108 países.
Todo mundo está subindo e descendo na pilha.
Parte disso provavelmente serve para aprofundar os fossos finos, parte para cortar custos, parte para justificar avaliações.

A OpenAI construiu um chip de inferência personalizado (Jalapeño) e passou do primeiro RTL para o tapeout em 9 meses.
Quando projetei e tapeei SoCs complexos, 18–24 meses do RTL até a tapeout era normal. Verificação e design físico consumiram a maior parte desse cronograma.
IA escrevendo Verilog/VHDL é meio esperado com todos os agentes de programação. A parte impressionante foi... @OpenAI equipe usou um modelo interno com feedback rápido de QoR e verificação robusta para otimizar o RTL
A IA está realmente comprimindo o ciclo de design... Bom para todos. Veríamos mais silício e mais inovação. Agora a diferenciação passa a garantir a capacidade do TSMC e a alocação de HBM...
Mais chips podem ser projetados... mas menos podem ser produzidos em larga escala.



A OpenAI está levando a sério a posse de toda a stack de IA
Jalapeño finalmente está saindo dos testes para a infraestrutura da OpenAI
> mais trabalho de IA a cada watt
> maior taxa de transferência com menor latência
> respostas mais rápidas do ChatGPT e do Codex
isso é apenas a Geração 1, a Gen 2 já está em desenvolvimento, enquanto a Gen 3 está tomando forma.
A OpenAI já tem os modelos, os usuários e a demanda.
Agora ele também está construindo o comput por baixo deles.
a verdadeira questão é até onde isso vai quando o Jalapeño começa a escalar sua infraestrutura.
Como você acha que a Geração 2 vai ser?


Desde que anunciamos o Jalapeño, nosso primeiro chip de inferência personalizado, temos testado ele e o sistema ao seu redor.
Os resultados mostram um grande avanço: mais inteligência a cada watt e respostas mais rápidas, entregando tanto maior taxa de transferência quanto menor latência em uma única arquitetura, sem sacrificar eficiência.
Os primeiros testes Jalapeño da OpenAI apontam para uma mudança potencialmente significativa na economia da inferência: 1,5x-1,9x mais taxa de transferência por watt e 1,7x-3,6x menor latência de ponta a ponta em modelos abertos. O GPT-5.6 Sol também teria usado 54% menos tokens de saída do que um rival líder em tarefas de programação.
O julgamento medido é que ganhos de eficiência podem melhorar a economia das unidades, mas os benchmarks testados pela empresa ainda não são prova de custos agregados mais baixos. Com US$ 6,7 bilhões em receita no segundo trimestre contra um prejuízo operacional de US$ 12,3 bilhões, a implantação em escala e o crescimento da carga de trabalho importarão mais do que o desempenho geral. Não é um conselho, apenas uma análise.
#OpenAIInferenceCostTest

O primeiro chip de inferência personalizado da OpenAI oferece maior taxa de transferência, menor latência e melhor eficiência em uma única arquitetura.
Quando o maior laboratório de IA começa a projetar seu próprio silício, a economia da inferência em escala tem um problema.
A camada de computação está sendo reconstruída do zero.
Desde que anunciamos o Jalapeño, nosso primeiro chip de inferência personalizado, temos testado ele e o sistema ao seu redor.
Os resultados mostram um grande avanço: mais inteligência a cada watt e respostas mais rápidas, entregando tanto maior taxa de transferência quanto menor latência em uma única arquitetura, sem sacrificar eficiência.


