#OpenAIInferenceCostTest

695,3 mil visualizações|216 publicação

About OpenAIInferenceCostTest

OpenAI shared early tests of Jalapeño, its first in-house inference chip. It says it delivers 1.5x-1.9x more throughput per watt on open models and cuts end-to-end latency by 1.7x-3.6x. Deployment is planned by year-end, with two successors in development. It also says GPT-5.6 Sol used 54% fewer output tokens than a leading rival on coding tasks. After $6.7B in Q2 revenue and a $12.3B operating loss, can these company-tested gains lower inference costs, narrow losses and support its IPO valuatio

OpenAIInferenceCostTest Publicações populares

TBNG_OKX
TBNG_OKX
#OpenAIQ2LossWidens Empresas em rápido crescimento nem sempre se tornam grandes negócios. A OpenAI continua a crescer, mas as perdas também estão a aumentar. A Anthropic está a seguir um caminho diferente, mostrando sinais precoces de rentabilidade. A receita é o que chama a atenção. A economia sustentável é geralmente o que decide quem vence a maratona. O que é mais importante para si hoje, crescimento ou rentabilidade?
Watcher_Guru
Watcher_Guru
ÚLTIMA HORA: Probabilidades de a Anthropic fazer IPO acima da valorização de $SPCX da SpaceX de $1,77 triliões.
anand iyer
anand iyer
Todo o foco em torno do Jalapeño parece estar centrado no desempenho em relação à Nvidia, mas a velocidade de engenharia por trás dele é verdadeiramente notável. Alguns destaques da palestra @hotchipsorg: 1. Construir chips personalizados costumava exigir exércitos massivos de engenheiros e cronogramas de vários anos. A OpenAI passou do código RTL inicial para tapeout em apenas 9 meses usando XLS (uma linguagem semelhante a Rust para hardware da Google) e co-design orientado por IA. 2. Um ciclo de IA pegou um kernel bruto, mal funcional (DeepSeek) rodando a 0,31% de eficiência e otimizou-o autonomamente para 88,94% do limite físico do chip em menos de 2 dias. 3. O código gerado por IA rodou até 1,8x mais rápido em blocos críticos do que implementações ajustadas manualmente por engenheiros de kernel de classe mundial. 4. A IA fez mais do que apenas escrever software para o chip. Otimizou os circuitos físicos de hardware antes do tapeout. Novamente, isto não é um jogo de soma zero nem um prejuízo para a Nvidia. ASICs personalizados desbloqueiam eficiências absurdas de serviço para cargas de trabalho especializadas e irão expandir o total de capacidade computacional para toda a indústria.
OpenAI
OpenAI
Desde o anúncio do Jalapeño, o nosso primeiro chip de inferência personalizado, temos vindo a testá-lo e o sistema à sua volta. Os resultados mostram um avanço significativo: mais inteligência por cada watt e respostas mais rápidas, oferecendo tanto maior rendimento como menor latência numa única arquitetura sem sacrificar a eficiência.
ℏεsam
ℏεsam
A OpenAI usou AI (modelos Sol e Astra) para ajudar a desenhar os chips Jalapeño que irão executar AI.
Benzinga
Benzinga
A OpenAI diz que o seu novo chip de IA Jalapeño pode reduzir significativamente o custo de execução da inteligência artificial, mas Jim Cramer (@jimcramer) mantém-se céptico quanto a que represente uma ameaça séria para a Nvidia ($NVDA). O Jalapeño é o primeiro chip de inferência personalizado da OpenAI e foi desenvolvido com a Broadcom ($AVGO). A empresa planeia começar a implementá-lo internamente até ao final de 2026, com a produção a aumentar ainda mais em 2027. O CEO da OpenAI, Sam Altman (@sama), descreveu o chip simplesmente dizendo: “Fizemos um chip e ele é rápido.” A empresa já está a trabalhar em versões de segunda e terceira geração. A OpenAI afirma que o Jalapeño pode oferecer tanto maior rendimento como menor latência, uma combinação difícil de alcançar. Os seus benchmarks internos mostraram melhor desempenho por watt do que os sistemas GB200 e GB300 da Nvidia em vários modelos grandes de IA. Dependendo da carga de trabalho, a OpenAI afirma que o Jalapeño proporcionou aproximadamente 1,5x a 1,9x mais desempenho por watt e uma latência significativamente menor. O chip foi concebido especificamente para inferência e não para treino de IA. O executivo de hardware da OpenAI, Richard Ho, disse que esses ganhos de eficiência poderiam eventualmente traduzir-se em preços mais baixos por token para os clientes à medida que o chip entra em produção. Ainda assim, a OpenAI não planeia substituir totalmente a Nvidia. A empresa disse que continuará a usar aceleradores Nvidia e hardware de outros parceiros tanto para treino como para inferência. Cramer rejeitou a ideia de que cada novo chip de IA representa um concorrente significativo para a Nvidia. Ele disse que ouve regularmente afirmações sobre chips superiores, mas continua a não ver “concorrentes reais” para a Nvidia em larga escala.
LJW
LJW
O Jalapeno da OpenAI é um sinal de que a indústria de IA está a entrar na era do “dominar a stack”. O manual costumava ser manter-se na sua área e focar-se. As empresas de modelos treinavam modelos. As empresas de chips fabricavam chips. As empresas de dados recolhiam dados. Essa era acabou. A OpenAI começou como um laboratório puramente de modelos. Agora estão a desenhar silício personalizado e a otimizar os sistemas completos em torno das suas cargas de trabalho reais. Esta semana também vimos @Figure_robot a avançar para a camada de dados e a lançar o Index, os seus próprios esforços de recolha de dados que abrangem 108 países. Todos estão a mover-se para cima e para baixo na stack. Parte disso é provavelmente para aprofundar fossos estreitos, parte para reduzir custos, parte para justificar avaliações.
Baris
Baris
A OpenAI construiu um chip de inferência personalizado (Jalapeño) e passou do primeiro RTL ao tapeout em 9 meses. Quando eu desenhava e fazia tapeout de SoCs complexos, 18–24 meses do RTL ao tapeout era normal. A verificação e o design físico consumiam a maior parte desse cronograma. Escrever Verilog/VHDL com AI é meio esperado com todos os agentes de codificação. A parte impressionante foi... a equipa @OpenAI usou um modelo interno com feedback rápido de QoR e verificação robusta para otimizar o RTL A AI está realmente a comprimir o ciclo de design... bom para todos. Veremos mais silício e mais inovação. Agora a diferenciação passa a garantir capacidade da TSMC e alocação de HBM.. Podem ser desenhados mais chips... mas menos podem ser produzidos em escala.
MaeveKnows
MaeveKnows
A OpenAI está a levar a sério a posse de toda a stack de IA Jalapeño está finalmente a passar dos testes para a infraestrutura da OpenAI > mais trabalho de IA por cada watt > maior rendimento com menor latência > respostas mais rápidas do ChatGPT e Codex isto é apenas a Geração 1, a geração 2 já está em desenvolvimento, enquanto a Geração 3 está a tomar forma. A OpenAI já tem os modelos, os utilizadores e a procura. agora está a construir também a capacidade computacional por baixo deles. a verdadeira questão é até onde isto vai quando o Jalapeño começar a escalar pela infraestrutura deles. o que achas que a Geração 2 vai parecer?
OpenAI
OpenAI
Desde o anúncio do Jalapeño, o nosso primeiro chip de inferência personalizado, temos vindo a testá-lo e o sistema à sua volta. Os resultados mostram um avanço significativo: mais inteligência por cada watt e respostas mais rápidas, oferecendo tanto maior rendimento como menor latência numa única arquitetura sem sacrificar a eficiência.
Birdie_OKX
Birdie_OKX
Os primeiros testes Jalapeño da OpenAI apontam para uma mudança potencialmente significativa na economia da inferência: 1,5x-1,9x mais rendimento por watt e 1,7x-3,6x menor latência de ponta a ponta em modelos abertos. Também foi relatado que o GPT-5.6 Sol usou 54% menos tokens de saída do que um concorrente líder em tarefas de codificação. O julgamento medido é que os ganhos de eficiência podem melhorar a economia unitária, mas os benchmarks testados pela empresa ainda não são prova de custos agregados mais baixos. Com 6,7 mil milhões de dólares em receitas no 2º trimestre contra uma perda operacional de 12,3 mil milhões de dólares, a implementação em larga escala e o crescimento da carga de trabalho serão mais importantes do que o desempenho em destaque. Não é aconselhamento, apenas análise. #OpenAIInferenceCostTest
Raven Protocol 🐦‍⬛
Raven Protocol 🐦‍⬛
O primeiro chip de inferência personalizado da OpenAI oferece maior rendimento, menor latência e melhor eficiência numa única arquitetura. Quando o maior laboratório de IA começa a desenhar o seu próprio silício, a economia da inferência em larga escala enfrenta um problema. A camada de computação está a ser reconstruída do zero.
OpenAI
OpenAI
Desde o anúncio do Jalapeño, o nosso primeiro chip de inferência personalizado, temos vindo a testá-lo e o sistema à sua volta. Os resultados mostram um avanço significativo: mais inteligência por cada watt e respostas mais rápidas, oferecendo tanto maior rendimento como menor latência numa única arquitetura sem sacrificar a eficiência.