
#OpenAIInferenceCostTest
About OpenAIInferenceCostTest
OpenAI shared early tests of Jalapeño, its first in-house inference chip. It says it delivers 1.5x-1.9x more throughput per watt on open models and cuts end-to-end latency by 1.7x-3.6x. Deployment is planned by year-end, with two successors in development. It also says GPT-5.6 Sol used 54% fewer output tokens than a leading rival on coding tasks. After $6.7B in Q2 revenue and a $12.3B operating loss, can these company-tested gains lower inference costs, narrow losses and support its IPO valuatio
Populär
Senaste
OpenAIInferenceCostTest Populära inlägg
#OpenAIQ2LossWidens
Snabbt växande företag blir inte alltid stora företag.
OpenAI fortsätter att växa, men förlusterna ökar också. Anthropic tar en annan väg genom att visa tidiga tecken på lönsamhet. Intäkter ger rubriker.
Hållbar ekonomi avgör vanligtvis vem som vinner maratonloppet. Vad är viktigast för dig idag, tillväxt eller lönsamhet?

NYLIGEN IN: Oddsen för att antropiska börsintroduktioner är högre än SpaceX:s värdeökning på 1,77 biljoner dollar på $SPCX.

Allt fokus kring Jalapeño verkar vara centrerat på prestanda gentemot Nvidia, men den tekniska hastigheten bakom det är verkligen anmärkningsvärd. Några höjdpunkter från @hotchipsorg föredraget:
1. Att bygga specialanpassade chip brukade kräva enorma arméer av ingenjörer och flerårstidsramar. OpenAI gick från initial RTL-kod till bandutsläpp på bara 9 månader med XLS (ett Rust-liknande språk för hårda lösningar från Google) och AI-driven samdesign.
2. En AI-loop tog en rå, knappt fungerande (DeepSeek) kärna som kördes på 0,31 % effektivitet och optimerade den autonomt till 88,94 % av chipets fysiska gräns på under 2 dagar.
3. Den AI-genererade koden kördes upp till 1,8 gånger snabbare på kritiska block än implementationer handjusterade av världsledande kärningenjörer.
4. AI gjorde mer än att bara skriva mjukvara för chipet. Den optimerade de fysiska hårdvarukretsarna innan tapeout.
Återigen, detta är varken nollsummesumma eller ett nettonegativt för Nvidia. Specialanpassade ASIC:er låser upp absurda serveringseffektiviseringar för specialiserade arbetsbelastningar och kommer att utöka den totala beräkningskakan för hela branschen.
Sedan vi presenterade Jalapeño, vårt första anpassade inferenschip, har vi testat det och systemet runt omkring.
Resultaten visar ett stort framsteg: mer intelligens från varje watt och snabbare svar, vilket ger både högre genomströmning och lägre latens i en och samma arkitektur utan att kompromissa med effektivitet.

OpenAI säger att deras nya Jalapeño AI-chip kan sänka kostnaden för att köra artificiell intelligens avsevärt, men Jim Cramer (@jimcramer) är skeptisk till att det utgör ett allvarligt hot mot Nvidia ($NVDA).
Jalapeño är OpenAIs första anpassade inferenschip och utvecklades tillsammans med Broadcom ($AVGO). Företaget planerar att börja distribuera det internt i slutet av 2026, med förväntad produktion att öka ytterligare under 2027.
OpenAI:s VD Sam Altman (@sama) beskrev chippet helt enkelt med orden: "Vi har gjort ett chip och det är snabbt." Företaget arbetar redan på andra- och tredje generationens versioner.
OpenAI säger att Jalapeño kan leverera både högre genomströmning och lägre latens, en kombination som är svår att uppnå. Deras interna benchmarks visade bättre prestanda per watt än Nvidias GB200- och GB300-system över flera stora AI-modeller.
Beroende på arbetsbelastningen hävdar OpenAI att Jalapeño levererade ungefär 1,5 till 1,9 gånger mer prestanda per watt och betydligt lägre latens. Chippet är specifikt designat för inferensträning snarare än AI-träning.
OpenAI:s hårdvaruchef Richard Ho sade att dessa effektivitetsökningar så småningom kan leda till lägre tokenpriser för kunderna när chipet skalar upp i produktion.
Ändå planerar OpenAI inte att helt ersätta Nvidia. Företaget sade att de kommer att fortsätta använda Nvidia-acceleratorer och hårdvara från andra partners för både träning och inferens.
Cramer avfärdade idén att varje nytt AI-chip representerar en meningsfull Nvidia-utmanare. Han sade att han regelbundet hör påståenden om överlägsna chip men fortsätter att se "inga verkliga konkurrenter" till Nvidia i stor skala.


OpenAI:s Jalapeno är en signal om att AI-industrin går in i "äg stacken"-eran.
Spelboken brukade vara att stanna i din lane och fokusera.
Modellföretag tränade modeller. Chipföretag tillverkade chip. Dataföretag samlade in data.
Den eran är över.
OpenAI började som ett rent modelllabb. Nu designar de specialbyggd kisel och optimerar hela systemen kring sina faktiska arbetsbelastningar.
Den här veckan såg vi också @Figure_robot gå in i datalagret och lansera Index, deras egna datainsamlingsinsatser som sträcker sig över 108 länder.
Alla rör sig upp och ner i högen.
En del av det är troligen för att fördjupa tunna vallgravar, en del för att minska kostnader, en del för att motivera värderingar.

OpenAI byggde ett specialanpassat inferenschip (Jalapeño) och gick från första RTL till tapeout på 9 månader.
När jag designade och tejpade ut komplexa SoC:er var det normalt att ta 18–24 månader från RTL till tapeout. Verifiering och fysisk design tog upp större delen av det schemat.
AI-skrivande av Verilog/VHDL är ganska förväntat med alla kodningsagenter. Det imponerande var... @OpenAI team använde en intern modell med snabb QoR-återkoppling och robust verifiering för att optimera RTL:n
AI komprimerar verkligen designcykeln.. Bra för alla. Vi skulle se mer kisel och mer innovation. Nu går differentieringen över till att säkra TSMC-kapacitet och HBM-allokering..
Fler chip kan designas.. men färre kan produceras i stor skala.



OpenAI börjar bli seriös med att äga hela AI-stacken
Jalapeño går äntligen från testning till OpenAI:s infrastruktur
> mer AI-arbete från varje watt
> högre genomströmning med lägre latens
> snabbare svar på ChatGPT och Codex
detta är bara Gen 1, generation 2 är redan under utveckling, medan Gen 3 håller på att ta form.
OpenAI har redan modellerna, användarna och efterfrågan.
Nu bygger den också upp beräkningen under dem.
den verkliga frågan är hur långt detta går när Jalapeño börjar skala upp över sin infrastruktur.
hur tror du att Gen 2 kommer att se ut?


Sedan vi presenterade Jalapeño, vårt första anpassade inferenschip, har vi testat det och systemet runt omkring.
Resultaten visar ett stort framsteg: mer intelligens från varje watt och snabbare svar, vilket ger både högre genomströmning och lägre latens i en och samma arkitektur utan att kompromissa med effektivitet.
OpenAI:s tidiga Jalapeño-tester pekar på en potentiellt meningsfull förändring i inferensekonomi: 1,5-1,9 gånger mer genomströmning per watt och 1,7-3,6 gånger lägre end-to-end-latens på öppna modeller. GPT-5.6 Sol använde också enligt uppgift 54 % färre utgångstoken än en ledande konkurrent på kodningsuppgifter.
Den mätta bedömningen är att effektivitetsvinster kan förbättra enhetsekonomin, men företagstestade riktmärken är ännu inte bevis på lägre sammanlagda kostnader. Med 6,7 miljarder dollar i intäkter under andra kvartalet jämfört med en rörelseförlust på 12,3 miljarder dollar kommer en omfattande utbyggnad och arbetsbelastningstillväxt att vara viktigare än den övergripande prestationen. Inte råd, bara analys.
#OpenAIInferenceCostTest

OpenAI:s första specialanpassade inferenschip levererar högre genomströmning, lägre latens och bättre effektivitet i en och samma arkitektur.
När det största AI-laboratoriet börjar designa sitt eget kisel har inferensekonomi i stor skala ett problem.
Beräkningslagret byggs upp från grunden.
Sedan vi presenterade Jalapeño, vårt första anpassade inferenschip, har vi testat det och systemet runt omkring.
Resultaten visar ett stort framsteg: mer intelligens från varje watt och snabbare svar, vilket ger både högre genomströmning och lägre latens i en och samma arkitektur utan att kompromissa med effektivitet.


