Free lesson · GenAI Inference Engineering
પ્રોવાઇડર લેન્ડસ્કેપ વિશ્લેષણ
Anthropic, OpenAI અને Google વચ્ચે API ક્ષમતાઓ, કિંમત અને શક્તિઓની તુલના કરો
Course: GenAI Inference Engineering · Chapter 1 · Production Hosted LLM Architecture
Free to read — no subscription required.
પરિચય
જ્યારે તમે વિકલ્પોનું સર્વેક્ષણ કર્યા વિના પ્રોડક્શન વર્કલોડ માટે એક જ LLM પ્રોવાઇડર પસંદ કરો છો, ત્યારે તમે સામાન્ય રીતે 3–10× વધુ ચૂકવો છો અથવા કોન્ટેક્સ્ટ-વિન્ડોની મર્યાદા સાથે અથડાઓ છો જે છ મહિના પછી ખર્ચાળ રીરાઇટ કરવા મજબૂર કરે છે. Anthropic, OpenAI અને Google દરેક ઓવરલેપ થતી ક્ષમતાઓ આપે છે, પરંતુ તેમના પ્રાઇસિંગ કર્વ, કેશ ડિસ્કાઉન્ટ, કોન્ટેક્સ્ટ લિમિટ અને ટૂલ-યુઝ એર્ગોનોમિક્સ તીવ્રપણે અલગ પડે છે — અને આ તફાવતો સીધા જ એ વાત સાથે જોડાય છે કે દરેક કયા વર્કલોડમાં સારું છે.
આ પાઠના અંત સુધીમાં તમે ત્રણ મુખ્ય ફ્રન્ટિયર પ્રોવાઇડરોની તુલના ઇન્ફરન્સ એન્જિનિયરિંગ માટે મહત્ત્વના પરિમાણો — મોડેલ ટિયર, કોન્ટેક્સ્ટ વિન્ડો, ઇનપુટ/આઉટપુટ પ્રાઇસિંગ અને કેશ ડિસ્કાઉન્ટ — પર કરી શકશો અને એક સરળ કોસ્ટ મોડેલનો ઉપયોગ કરીને કોઈ ચોક્કસ વર્કલોડ માટે પ્રોવાઇડરની પસંદગીને વાજબી ઠેરવી શકશો.
મુખ્ય પરિભાષા
- ફ્રન્ટિયર મોડેલ — પ્રોવાઇડર હાલમાં જે સૌથી વધુ ક્ષમતાવાળો ટિયર શિપ કરે છે તે (દા.ત. Claude 3.5 Sonnet, GPT-4o, Gemini 1.5 Pro). તમે શું કરી શકો તેની ઉપલી મર્યાદા નક્કી કરે છે; તમે પ્રતિ ટોકન કેટલું ચૂકવો તેની ઉપલી મર્યાદા પણ નક્કી કરે છે.
- કોન્ટેક્સ્ટ વિન્ડો — એક રિક્વેસ્ટમાં સમાવી શકાય તેવી ટોકન્સની મહત્તમ સંખ્યા (prompt + completion). RAG અથવા સમરાઇઝેશનની જરૂર પડે તે પહેલાં તમે એક ટર્નમાં કેટલી રિટ્રીવ કરેલી અથવા ઐતિહાસિક સામગ્રી ભરી શકો તેની મર્યાદા નક્કી કરે છે.
- પ્રોમ્પ્ટ કેશિંગ — પ્રોવાઇડર-દીઠ એક ફીચર જે ફરીથી મોકલેલા પ્રિફિક્સ ટોકન્સ માટે ઘટાડેલો દર વસૂલે છે. Anthropic કેશ કરેલા ઇનપુટ પર 90% સુધી છૂટ આપે છે; OpenAI આપમેળે 50% છૂટ આપે છે; Google મેન્યુઅલ લાઇફસાઇકલ સાથે સ્પષ્ટ કોન્ટેક્સ્ટ કેશિંગ આપે છે.
- ટોકન પ્રાઇસિંગ અસમપ્રમાણતા — દરેક પ્રોવાઇડર પર આઉટપુટ ટોકન્સની કિંમત ઇનપુટ ટોકન્સથી આશરે 4–5× હોય છે. આ ગુણોત્તરનો અર્થ એ છે કે ચેટ વર્કલોડ પર સામાન્ય રીતે પ્રોમ્પ્ટની લંબાઈ નહીં, પણ જનરેશનની લંબાઈ ખર્ચ પર પ્રભુત્વ ધરાવે છે.
- રીઝનિંગ મોડેલ — એક ટિયર (OpenAI o1/o3, Gemini Thinking) જે દૃશ્યમાન જવાબ પહેલાં વધારાના છુપાયેલા "રીઝનિંગ ટોકન્સ" વાપરે છે. ગણિત/કોડ પર વધુ ચોકસાઈ, પરંતુ એ છુપાયેલા ટોકન્સ માટે બિલ ચૂકવવું પડે છે.
સંકલ્પનાઓ
ત્રણ પ્રોવાઇડરો તેઓ શેના માટે ઓપ્ટિમાઇઝ કરે છે તે આધારે જૂથબદ્ધ થાય છે: Anthropic કેશ-આક્રમક એન્ટરપ્રાઇઝ વર્કલોડ માટે, OpenAI ફીચર્સની વ્યાપકતા અને રીઝનિંગ મોડેલો માટે, Google ખૂબ લાંબા કોન્ટેક્સ્ટ અને મલ્ટિમોડલ ઇનપુટ માટે. નીચેનો ડાયાગ્રામ ટિયર અને પ્રોવાઇડર પસંદગી ચલાવતા ભેદક પરિબળોને દર્શાવે છે.
Anthropic Claude ટિયર
એક 200K-ટોકન કોન્ટેક્સ્ટ વિન્ડોમાં ત્રણ ટિયર. Sonnet ડિફૉલ્ટ વર્કહોર્સ છે, પ્રતિ મિલિયન ટોકન $3 ઇનપુટ / $15 આઉટપુટ પર. Haiku $0.25 / $1.25 સુધી ઘટે છે — જ્યારે લેટન્સી અને વોલ્યુમ ટોચના રીઝનિંગ કરતાં વધુ મહત્ત્વના હોય ત્યારે સૌથી સસ્તો ગંભીર ટિયર. Opus $15 / $75 પર પ્રીમિયમ ટિયર છે, એવા કાર્યો માટે જ્યાં Sonnet સ્પષ્ટપણે ઓછું પ્રદર્શન કરે છે. મુખ્ય ભેદક પરિબળ છે કેશ કરેલા ઇનપુટ પર 90% સુધી છૂટ સાથે પ્રોમ્પ્ટ કેશિંગ — બજારમાં સૌથી મોટું કેશ ડિસ્કાઉન્ટ — જે Anthropic ને રિટ્રીવલ-ઑગમેન્ટેડ ચેટ માટે પ્રભાવી બનાવે છે જ્યાં સમાન સિસ્ટમ પ્રોમ્પ્ટ અને ડોક્યુમેન્ટ સેટ ટર્ન દરમિયાન પુનરાવર્તિત થાય છે.
OpenAI GPT અને રીઝનિંગ ટિયર
GPT-4o $2.50 / $10 પર 128K કોન્ટેક્સ્ટ સાથેનું ફ્લેગશિપ મલ્ટિમોડલ મોડેલ છે. GPT-4o-mini $0.15 / $0.60 પર મોટાભાગના બિન-ફ્રન્ટિયર વર્કલોડ માટે કિંમત-પ્રદર્શનનું શ્રેષ્ઠ બિંદુ છે. o1 / o3 રીઝનિંગ મોડેલો ગણિત, કોડ અને મલ્ટિ-સ્ટેપ લોજિક પર ચોકસાઈ માટે લેટન્સીનો સોદો કરે છે, છુપાયેલા રીઝનિંગ ટોકન્સ વાપરીને જેના માટે તમે હજી પણ ચૂકવણી કરો છો. OpenAI ની વિશિષ્ટ ચાલો: કોઈ કોડ બદલાવ વિના આપમેળે 50% કેશ ડિસ્કાઉન્ટ, 24-કલાકના ટર્નઅરાઉન્ડ માટે 50% છૂટ સાથે Batch API, અને Structured Outputs જે કન્સ્ટ્રેઇન્ડ ડીકોડિંગ દ્વારા JSON-schema અનુપાલનની ખાતરી આપે છે (જુઓ કોડ વૉકથ્રૂ).
Google Gemini લોંગ-કોન્ટેક્સ્ટ ટિયર
Gemini 2.0 Flash $0.075 / $0.30 પર 1M-ટોકન કોન્ટેક્સ્ટ સાથે બજારમાં સૌથી સસ્તું ગંભીર ફ્રન્ટિયર મોડેલ છે. Gemini 1.5 Pro $1.25 / $5.00 પર 2M-ટોકન કોન્ટેક્સ્ટ સુધી વિસ્તરે છે — ઉદ્યોગમાં સૌથી મોટું — જે તમને RAG વિના એક જ પ્રોમ્પ્ટમાં સંપૂર્ણ કોડબેઝ અથવા પુસ્તક-લંબાઈના દસ્તાવેજો સમાવવા દે છે. નેટિવ મલ્ટિમોડલ ઇનપુટ (ઇમેજ, ઑડિયો, વિડિયો) અને મેન્યુઅલ TTL સાથે સ્પષ્ટ કોન્ટેક્સ્ટ કેશિંગ ભેદક પરિબળોને પૂર્ણ કરે છે.
કોડ વૉકથ્રૂ
હવે જ્યારે તમારી સામે ત્રણ પ્રોવાઇડરોના ટિયર, કોન્ટેક્સ્ટ વિન્ડો અને કેશ-ડિસ્કાઉન્ટ મિકેનિક્સ છે, નીચેનો સ્નિપેટ તેમને એક નિર્ણય સાધનમાં જોડે છે: એક નાનું કોસ્ટ એસ્ટિમેટર જે વર્કલોડના ઇનપુટ/આઉટપુટ ટોકન વોલ્યુમ અને કેશ હિટ રેટનો અંદાજ લે છે, પછી પ્રોવાઇડર ટિયર દીઠ અપેક્ષિત માસિક ખર્ચ છાપે છે જેથી તમે અનુમાન પર નહીં, આંકડા પર પસંદગી કરી શકો.
Code snippetpython
1from dataclasses import dataclass 2 3@dataclass(frozen=True) 4class Tier: 5 provider: str 6 name: str 7 input_per_mtok: float # USD per million input tokens 8 output_per_mtok: float # USD per million output tokens 9 cache_discount: float # fraction off input on cache hit (0.0-1.0) 10 context_tokens: int 11 12TIERS = [ 13 Tier("anthropic", "claude-3.5-sonnet", 3.00, 15.00, 0.90, 200_000), 14 Tier("anthropic", "claude-3.5-haiku", 0.25, 1.25, 0.90, 200_000), 15 Tier("openai", "gpt-4o", 2.50, 10.00, 0.50, 128_000), 16 Tier("openai", "gpt-4o-mini", 0.15, 0.60, 0.50, 128_000), 17 Tier("google", "gemini-2.0-flash", 0.075, 0.30, 0.75, 1_000_000), 18 Tier("google", "gemini-1.5-pro", 1.25, 5.00, 0.75, 2_000_000), 19] 20 21def monthly_cost(tier: Tier, input_mtok: float, output_mtok: float, 22 cache_hit_rate: float) -> float: 23 cached_in = input_mtok * cache_hit_rate 24 fresh_in = input_mtok * (1 - cache_hit_rate) 25 input_cost = (fresh_in + cached_in * (1 - tier.cache_discount)) * tier.input_per_mtok 26 return input_cost + output_mtok * tier.output_per_mtok 27 28def rank_for_workload(input_mtok: float, output_mtok: float, 29 cache_hit_rate: float, min_context: int) -> list[tuple[Tier, float]]: 30 eligible = [t for t in TIERS if t.context_tokens >= min_context] 31 return sorted(((t, monthly_cost(t, input_mtok, output_mtok, cache_hit_rate)) 32 for t in eligible), key=lambda x: x[1]) 33 34# Example: RAG chat — 500 Mtok in, 50 Mtok out, 70% cache hit, needs 128K ctx. 35for tier, cost in rank_for_workload(500, 50, 0.70, 128_000): 36 print(f"{tier.provider:10s} {tier.name:22s} ${cost:>10,.0f}/mo")
જ્યારે તમારા વર્કલોડના વાસ્તવિક ઇનપુટ/આઉટપુટ ટોકન વોલ્યુમ અને કેશ હિટ રેટ માટે આ ચલાવવાથી ટિયર દીઠ માસિક ખર્ચનો અંદાજ મળે, અને સૌથી સસ્તો પાત્ર ટિયર તમારી લેટન્સી અને ક્ષમતાની જરૂરિયાતો સાથે મેળ ખાય, ત્યારે કામ પૂર્ણ થયું ગણાય. જો સૌથી સસ્તો ટિયર ગુણવત્તામાં ઓછો પડે, તો આગામી મર્યાદા (રીઝનિંગ ક્ષમતા, મલ્ટિમોડલ, સ્ટ્રક્ચર્ડ આઉટપુટ) દ્વારા ફરીથી ક્રમ આપો અને તેને પાર કરતો સૌથી સસ્તો ટિયર પસંદ કરો.
માટે વ્યવહારમાં
તમે હમણાં જે કોસ્ટ એસ્ટિમેટર જોયું તેના આધારે, સમાન મોડેલ અને ટિયર તુલના બધા પ્રોવાઇડરો પર સામાન્ય બને છે — પરંતુ પસંદગી ચલાવતી વર્કલોડ પેટર્ન શાખા-વિશિષ્ટ હોય છે. નીચેનું ઓવરલે દર્શાવે છે કે તમારી ભૂમિકા માટે પ્રોવાઇડર પસંદગી કેવી દેખાય છે.
કરવા જેવું અને ન કરવા જેવું
તમારી શાખાના વર્કલોડ માટે પ્રોવાઇડર પસંદગીને હમણાં જ માપ્યા પછી, નીચેના નિયમો એવી ચાલોને સારરૂપે રજૂ કરે છે જે આ પસંદગીને સતત સસ્તી અને પલટાવી શકાય તેવી રાખે છે — અને એવી જાળો જે શાંતિથી બિલ વધારે છે.
કરવા જેવું
- વાસ્તવિક ટોકન વોલ્યુમ પર ખર્ચનું મોડેલ બનાવો — પ્રોડક્શન લોગનું એક અઠવાડિયું લો, રિક્વેસ્ટ દીઠ સરેરાશ ઇનપુટ/આઉટપુટ ટોકન્સ અને કેશ-હિટ થઈ શકે તેવી પ્રિફિક્સ લંબાઈ માપો, પછી એ આંકડા એસ્ટિમેટરમાં નાખો. વેન્ડરના પ્રાઇસિંગ પેજ એવા વોલ્યુમ ધારે છે જે તમારી પાસે વાસ્તવમાં નથી.
- ગુણવત્તાની કસોટી પાર કરતો સૌથી સસ્તો ટિયર પસંદ કરો — ખર્ચ-ક્રમાંકિત યાદીથી શરૂ કરો, પછી તમારા ઇવૅલ સેટમાં નિષ્ફળ જતા ટિયર બાકાત કરો. "સલામતી માટે" સૌથી વધુ ક્ષમતાવાળો ટિયર પસંદ કરવો એ જ રીતે ટીમો 5× વધુ ખર્ચ કરે છે.
- કેશ હિટ માટે પ્રોમ્પ્ટ પ્રિફિક્સ ડિઝાઇન કરો — સ્થિર સામગ્રી (સિસ્ટમ પ્રોમ્પ્ટ, રિટ્રીવ કરેલા ડૉક્સ, ફ્યુ-શૉટ ઉદાહરણો) પહેલાં અને ગતિશીલ સામગ્રી (યુઝર ટર્ન) છેલ્લે મૂકો. Anthropic ના 90% ડિસ્કાઉન્ટ સાથે, યોગ્ય ક્રમમાં ગોઠવેલો પ્રિફિક્સ ચેટ વર્કલોડ પર ઇનપુટ ખર્ચ 80%+ ઘટાડી શકે છે.
ન કરવા જેવું
- આર્કિટેક્ચર સમયે એક જ પ્રોવાઇડરમાં લૉક ન થાઓ — પ્રોવાઇડર કૉલને એક પાતળા એડેપ્ટર પાછળ રાખો જેથી પ્રાઇસિંગ અને ક્ષમતાઓ બદલાય તેમ તમે દર ત્રિમાસિકે વર્કલોડ માટે ફરીથી બિડ કરી શકો. આ પાઠમાં પ્રતિ-મિલિયન-ટોકન સૌથી સસ્તો ટિયર તમારા આગામી પર્ફોર્મન્સ રિવ્યૂ પહેલાં બદલાઈ જશે.
- આઉટપુટ-ટોકન ખર્ચને અવગણશો નહીં — દરેક પ્રોવાઇડર પર આઉટપુટ ઇનપુટ કિંમતથી 4–5× છે, તેથી જનરેશન લંબાઈ પ્રભુત્વ ધરાવે છે. એક
max_tokensમર્યાદા અને "સંક્ષિપ્ત રહો" સિસ્ટમ સૂચના ખર્ચ પર ઘણીવાર કોઈપણ પ્રોવાઇડર બદલાવને હરાવે છે. - જે કોન્ટેક્સ્ટ તમે વાપરતા નથી તેના માટે ચૂકવણી ન કરો — Gemini ની 2M વિન્ડો એક ફીચર છે, ડિફૉલ્ટ રિક્વેસ્ટ સાઇઝ નથી. જ્યાં 20K પૂરતું હોય ત્યાં 500K-ટોકન પ્રોમ્પ્ટ મોકલવો સીધો વધારાનો ખર્ચ છે; રિક્વેસ્ટને જવાબ સમાવતા સૌથી નાના કોન્ટેક્સ્ટ પ્રમાણે માપો.
A hands-on lab comes with this lesson — real code, in a cloud IDE. Create a free account to run it. No card.
Free account · no card · straight to the lab
Or get the full path — from
Listen to this lesson
Audio overviews of this lesson's labs and its chapter, from GenBodha Bytes.
- Build a Live Provider BenchmarkerLab4 min
- Production Hosted LLM ArchitectureChapter overview3 min
More free lessons in GenAI Inference Engineering
- Ch 1Provider Landscape AnalysisYou are here
- Ch 1Token Economics
- Ch 1Rate Limit Management