#OpenAIInferenceCostTest

714,6 mil visualizações|216 de publicações

About OpenAIInferenceCostTest

OpenAI shared early tests of Jalapeño, its first in-house inference chip. It says it delivers 1.5x-1.9x more throughput per watt on open models and cuts end-to-end latency by 1.7x-3.6x. Deployment is planned by year-end, with two successors in development. It also says GPT-5.6 Sol used 54% fewer output tokens than a leading rival on coding tasks. After $6.7B in Q2 revenue and a $12.3B operating loss, can these company-tested gains lower inference costs, narrow losses and support its IPO valuatio

OpenAIInferenceCostTest Publicações populares

TBNG_OKX
TBNG_OKX
#OpenAIQ2LossWidens Empresas que crescem rápido nem sempre se tornam grandes negócios. A OpenAI continua crescendo, mas as perdas também estão crescendo. A Anthropic está seguindo um caminho diferente ao mostrar sinais iniciais de lucratividade. Receita ganha manchetes. A economia sustentável geralmente decide quem vence a maratona. O que importa mais para você hoje, crescimento ou lucratividade?
Watcher_Guru
Watcher_Guru
RECENTEMENTE CHEGADO: Chances de IPO da Anthropic acima do aumento de avaliação de $SPCX US$ 1,77 trilhão da SpaceX.
anand iyer
anand iyer
Todo o foco em torno do Jalapeño parece estar centrado no desempenho em relação à Nvidia, mas a velocidade de engenharia por trás dele é realmente notável. Alguns destaques da palestra @hotchipsorg: 1. Construir chips personalizados costumava exigir exércitos massivos de engenheiros e prazos de vários anos. A OpenAI passou do código RTL inicial para o tapeout em apenas 9 meses usando XLS (uma linguagem semelhante à Rust para hardwares do Google) e co-design impulsionado por IA. 2. Um ciclo de IA pegou um kernel bruto e quase infuncional (DeepSeek) rodando com 0,31% de eficiência e o otimizou autonomamente para 88,94% do limite físico do chip em menos de 2 dias. 3. O código gerado por IA rodava até 1,8x mais rápido em blocos críticos do que implementações ajustadas manualmente por engenheiros de kernel de classe mundial. 4. A IA fazia mais do que apenas escrever software para o chip. Otimizava os circuitos físicos de hardware antes da tapeout. Novamente, isso não é soma zero nem um saldo negativo para a Nvidia. ASICs personalizados desbloqueiam eficiências absurdas de serviço para cargas de trabalho especializadas e expandirão o total de computação para toda a indústria.
OpenAI
OpenAI
Desde que anunciamos o Jalapeño, nosso primeiro chip de inferência personalizado, temos testado ele e o sistema ao seu redor. Os resultados mostram um grande avanço: mais inteligência a cada watt e respostas mais rápidas, entregando tanto maior taxa de transferência quanto menor latência em uma única arquitetura, sem sacrificar eficiência.
ℏεsam
ℏεsam
A OpenAI usou IA (modelos Sol e Astra) para ajudar a projetar os chips Jalapeño que vão rodar IA.
Benzinga
Benzinga
A OpenAI afirma que seu novo chip de IA Jalapeño pode reduzir significativamente o custo de rodar inteligência artificial, mas Jim Cramer (@jimcramer) permanece cético quanto a sua ameaça séria para a Nvidia ($NVDA). Jalapeño é o primeiro chip de inferência personalizado da OpenAI e foi desenvolvido com a Broadcom ($AVGO). A empresa planeja começar a implantá-la internamente até o final de 2026, com a produção prevista para aumentar ainda mais em 2027. O CEO da OpenAI, Sam Altman (@sama), descreveu o chip simplesmente dizendo: "Nós fizemos um chip e ele é rápido." A empresa já está trabalhando em versões de segunda e terceira geração. A OpenAI afirma que o Jalapeño pode entregar tanto maior taxa quanto menor latência, uma combinação difícil de alcançar. Seus benchmarks internos mostraram desempenho por watt melhor do que os sistemas GB200 e GB300 da Nvidia em vários grandes modelos de IA. Dependendo da carga de trabalho, a OpenAI afirma que o Jalapeño entregou aproximadamente 1,5x a 1,9x mais desempenho por watt e latência significativamente menor. O chip foi projetado especificamente para inferência, e não para treinamento de IA. O executivo de hardware da OpenAI, Richard Ho, disse que esses ganhos de eficiência poderiam, eventualmente, se traduzir em preços mais baixos dos tokens para os clientes à medida que o chip avança para a produção. Ainda assim, a OpenAI não planeja substituir totalmente a Nvidia. A empresa afirmou que continuará utilizando aceleradores Nvidia e hardware de outros parceiros tanto para treinamento quanto para inferência. Cramer descartou a ideia de que cada novo chip de IA representa um desafiante significativo da Nvidia. Ele disse que ouve regularmente alegações sobre chips superiores, mas continua vendo "nenhum concorrente real" para a Nvidia em grande escala.
LJW
LJW
Jalapeño, da OpenAI, é um sinal de que a indústria de IA está entrando na era do "possuir a pilha". O manual costumava ser ficar na sua rota e focar. Empresas de modelos treinavam modelos. As empresas de chips fabricavam chips. Empresas de dados coletaram dados. Essa era acabou. A OpenAI começou como um laboratório puramente modelista. Agora eles estão projetando silício personalizado e otimizando todos os sistemas de acordo com suas cargas de trabalho reais. Esta semana também vimos @Figure_robot migrando para a camada de dados e lançando o Index, seus próprios esforços de coleta de dados que abrangem 108 países. Todo mundo está subindo e descendo na pilha. Parte disso provavelmente serve para aprofundar os fossos finos, parte para cortar custos, parte para justificar avaliações.
Baris
Baris
A OpenAI construiu um chip de inferência personalizado (Jalapeño) e passou do primeiro RTL para o tapeout em 9 meses. Quando projetei e tapeei SoCs complexos, 18–24 meses do RTL até a tapeout era normal. Verificação e design físico consumiram a maior parte desse cronograma. IA escrevendo Verilog/VHDL é meio esperado com todos os agentes de programação. A parte impressionante foi... @OpenAI equipe usou um modelo interno com feedback rápido de QoR e verificação robusta para otimizar o RTL A IA está realmente comprimindo o ciclo de design... Bom para todos. Veríamos mais silício e mais inovação. Agora a diferenciação passa a garantir a capacidade do TSMC e a alocação de HBM... Mais chips podem ser projetados... mas menos podem ser produzidos em larga escala.
MaeveKnows
MaeveKnows
A OpenAI está levando a sério a posse de toda a stack de IA Jalapeño finalmente está saindo dos testes para a infraestrutura da OpenAI > mais trabalho de IA a cada watt > maior taxa de transferência com menor latência > respostas mais rápidas do ChatGPT e do Codex isso é apenas a Geração 1, a Gen 2 já está em desenvolvimento, enquanto a Gen 3 está tomando forma. A OpenAI já tem os modelos, os usuários e a demanda. Agora ele também está construindo o comput por baixo deles. a verdadeira questão é até onde isso vai quando o Jalapeño começa a escalar sua infraestrutura. Como você acha que a Geração 2 vai ser?
OpenAI
OpenAI
Desde que anunciamos o Jalapeño, nosso primeiro chip de inferência personalizado, temos testado ele e o sistema ao seu redor. Os resultados mostram um grande avanço: mais inteligência a cada watt e respostas mais rápidas, entregando tanto maior taxa de transferência quanto menor latência em uma única arquitetura, sem sacrificar eficiência.
Birdie_OKX
Birdie_OKX
Os primeiros testes Jalapeño da OpenAI apontam para uma mudança potencialmente significativa na economia da inferência: 1,5x-1,9x mais taxa de transferência por watt e 1,7x-3,6x menor latência de ponta a ponta em modelos abertos. O GPT-5.6 Sol também teria usado 54% menos tokens de saída do que um rival líder em tarefas de programação. O julgamento medido é que ganhos de eficiência podem melhorar a economia das unidades, mas os benchmarks testados pela empresa ainda não são prova de custos agregados mais baixos. Com US$ 6,7 bilhões em receita no segundo trimestre contra um prejuízo operacional de US$ 12,3 bilhões, a implantação em escala e o crescimento da carga de trabalho importarão mais do que o desempenho geral. Não é um conselho, apenas uma análise. #OpenAIInferenceCostTest
Raven Protocol 🐦‍⬛
Raven Protocol 🐦‍⬛
O primeiro chip de inferência personalizado da OpenAI oferece maior taxa de transferência, menor latência e melhor eficiência em uma única arquitetura. Quando o maior laboratório de IA começa a projetar seu próprio silício, a economia da inferência em escala tem um problema. A camada de computação está sendo reconstruída do zero.
OpenAI
OpenAI
Desde que anunciamos o Jalapeño, nosso primeiro chip de inferência personalizado, temos testado ele e o sistema ao seu redor. Os resultados mostram um grande avanço: mais inteligência a cada watt e respostas mais rápidas, entregando tanto maior taxa de transferência quanto menor latência em uma única arquitetura, sem sacrificar eficiência.