Free lesson · GenAI Inference Engineering
ప్రొవైడర్ ల్యాండ్స్కేప్ విశ్లేషణ
Anthropic, OpenAI మరియు Google అంతటా API సామర్థ్యాలు, ధరలు మరియు బలాలను పోల్చండి
Course: GenAI Inference Engineering · Chapter 1 · Production Hosted LLM Architecture
Free to read — no subscription required.
పరిచయం
ప్రత్యామ్నాయాలను పరిశీలించకుండా ఒక ప్రొడక్షన్ వర్క్లోడ్ కోసం ఒకే LLM ప్రొవైడర్ను ఎంచుకున్నప్పుడు, మీరు సాధారణంగా 3–10× అధికంగా చెల్లిస్తారు, లేదా ఆరు నెలల తర్వాత ఖరీదైన రీరైట్కు దారితీసే కాంటెక్స్ట్-విండో పరిమితిని ఎదుర్కొంటారు. Anthropic, OpenAI, మరియు Google ప్రతి ఒక్కటీ ఒకదానితో మరొకటి అతివ్యాప్తి చెందే సామర్థ్యాలను అందిస్తాయి, కానీ వాటి ధరల వక్రరేఖలు, క్యాష్ డిస్కౌంట్లు, కాంటెక్స్ట్ పరిమితులు, మరియు టూల్-యూజ్ ఎర్గోనామిక్స్ తీవ్రంగా విభేదిస్తాయి — మరియు ఆ తేడాలు ప్రతి ప్రొవైడర్ ఏ వర్క్లోడ్లలో మంచిదో నేరుగా సూచిస్తాయి.
ఈ పాఠం ముగిసే సమయానికి, ఇన్ఫరెన్స్ ఇంజనీరింగ్కు ముఖ్యమైన కొలమానాలలో — మోడల్ టియర్లు, కాంటెక్స్ట్ విండో, ఇన్పుట్/అవుట్పుట్ ధర, మరియు క్యాష్ డిస్కౌంట్ — మూడు ప్రధాన ఫ్రాంటియర్ ప్రొవైడర్లను పోల్చగలరు, మరియు ఒక సాధారణ కాస్ట్ మోడల్ ఉపయోగించి ఒక నిర్దిష్ట వర్క్లోడ్ కోసం ప్రొవైడర్ ఎంపికను సమర్థించగలరు.
ముఖ్య పదజాలం
- ఫ్రాంటియర్ మోడల్ — ఒక ప్రొవైడర్ ప్రస్తుతం అందిస్తున్న అత్యధిక-సామర్థ్య టియర్ (ఉదా. Claude 3.5 Sonnet, GPT-4o, Gemini 1.5 Pro). మీరు ఏమి చేయగలరో దానికి పై పరిమితిని నిర్ణయిస్తుంది; ప్రతి టోకెన్కు మీరు ఎంత చెల్లిస్తారో దానికీ పై పరిమితిని నిర్ణయిస్తుంది.
- కాంటెక్స్ట్ విండో — ఒకే రిక్వెస్ట్లో చేర్చగలిగే గరిష్ట టోకెన్ల సంఖ్య (ప్రాంప్ట్ + కంప్లీషన్). RAG లేదా సమ్మరైజేషన్ అవసరం పడకముందు ఒక టర్న్లో ఎంత రిట్రీవ్ చేసిన లేదా చరిత్రాత్మక కంటెంట్ను కుక్కగలరో దీనిపై ఆధారపడుతుంది.
- ప్రాంప్ట్ క్యాషింగ్ — మళ్లీ పంపిన ప్రిఫిక్స్ టోకెన్లకు తగ్గిన రేటు వసూలు చేసే ప్రొవైడర్-వారీ ఫీచర్. Anthropic క్యాష్ చేసిన ఇన్పుట్పై 90% వరకు తగ్గింపు అందిస్తుంది; OpenAI ఆటోమేటిక్గా 50% తగ్గింపు అందిస్తుంది; Google మాన్యువల్ లైఫ్సైకిల్తో స్పష్టమైన కాంటెక్స్ట్ క్యాషింగ్ అందిస్తుంది.
- టోకెన్ ధరల అసమతుల్యత — ప్రతి ప్రొవైడర్ దగ్గరా అవుట్పుట్ టోకెన్లు ఇన్పుట్ టోకెన్ల కంటే సుమారుగా 4–5× ఖరీదు. ఈ నిష్పత్తి అర్థం ఏమిటంటే, చాట్ వర్క్లోడ్లలో ప్రాంప్ట్ పొడవు కాకుండా జనరేషన్ పొడవే సాధారణంగా ఖర్చును నిర్ణయిస్తుంది.
- రీజనింగ్ మోడల్ — కనిపించే జవాబు ముందు అదనపు దాచిన "రీజనింగ్ టోకెన్లను" వినియోగించే టియర్ (OpenAI o1/o3, Gemini Thinking). గణితం/కోడ్పై అధిక ఖచ్చితత్వం, కానీ ఆ దాచిన టోకెన్లకు బిల్లు వేయబడుతుంది.
భావనలు
మూడు ప్రొవైడర్లు అవి ఏమి ఆప్టిమైజ్ చేస్తాయో దాని ఆధారంగా సమూహాలుగా విడిపోతాయి: Anthropic క్యాష్-ఆధారిత ఎంటర్ప్రైజ్ వర్క్లోడ్ల కోసం, OpenAI విస్తృత ఫీచర్లు మరియు రీజనింగ్ మోడల్స్ కోసం, Google చాలా పొడవైన కాంటెక్స్ట్లు మరియు మల్టీమోడల్ ఇన్పుట్ కోసం. కింది రేఖాచిత్రం టియర్లను మరియు ప్రొవైడర్ ఎంపికను నిర్ణయించే విభేదకాలను చూపుతుంది.
Anthropic Claude టియర్లు
ఒకే 200K-టోకెన్ కాంటెక్స్ట్ విండోలో మూడు టియర్లు. Sonnet మిలియన్ టోకెన్లకు $3 ఇన్పుట్ / $15 అవుట్పుట్ ధరతో డిఫాల్ట్ వర్క్హార్స్. Haiku $0.25 / $1.25 కు తగ్గుతుంది — అత్యున్నత రీజనింగ్ కంటే లేటెన్సీ మరియు వాల్యూమ్ ముఖ్యమైనప్పుడు అత్యంత చౌకైన సీరియస్ టియర్. Opus $15 / $75 ధరతో ప్రీమియం టియర్, Sonnet స్పష్టంగా తక్కువ పనితీరు చూపే పనుల కోసం. ప్రధాన విభేదకం క్యాష్ చేసిన ఇన్పుట్పై 90% వరకు తగ్గింపు ఇచ్చే ప్రాంప్ట్ క్యాషింగ్ — మార్కెట్లో అత్యంత ఎక్కువ క్యాష్ డిస్కౌంట్ — ఇది ఒకే సిస్టమ్ ప్రాంప్ట్ మరియు డాక్యుమెంట్ సెట్ టర్న్ల మధ్య పునరావృతమయ్యే రిట్రీవల్-ఆగ్మెంటెడ్ చాట్కు Anthropicను ఆధిపత్యంలో ఉంచుతుంది.
OpenAI GPT మరియు రీజనింగ్ టియర్లు
$2.50 / $10 ధరతో GPT-4o 128K కాంటెక్స్ట్తో ఫ్లాగ్షిప్ మల్టీమోడల్ మోడల్. $0.15 / $0.60 ధరతో GPT-4o-mini చాలా నాన్-ఫ్రాంటియర్ వర్క్లోడ్లకు ధర-పనితీరు స్వీట్ స్పాట్. o1 / o3 రీజనింగ్ మోడల్స్ మీరు ఇప్పటికీ చెల్లించే దాచిన రీజనింగ్ టోకెన్లను వినియోగించడం ద్వారా గణితం, కోడ్, మరియు బహుళ-దశల లాజిక్పై ఖచ్చితత్వం కోసం లేటెన్సీని త్యాగం చేస్తాయి. OpenAI యొక్క విలక్షణ అంశాలు: కోడ్ మార్పులు లేకుండా ఆటోమేటిక్ 50% క్యాష్ డిస్కౌంట్, 24-గంటల టర్న్అరౌండ్కు 50% తగ్గింపుతో Batch API, మరియు కన్స్ట్రెయిన్డ్ డీకోడింగ్ ద్వారా JSON-స్కీమా అనుగుణ్యతను హామీ ఇచ్చే Structured Outputs (కోడ్ వాక్త్రూ చూడండి).
Google Gemini లాంగ్-కాంటెక్స్ట్ టియర్లు
1M-టోకెన్ కాంటెక్స్ట్తో $0.075 / $0.30 ధరతో Gemini 2.0 Flash మార్కెట్లో అత్యంత చౌకైన సీరియస్ ఫ్రాంటియర్ మోడల్. $1.25 / $5.00 ధరతో Gemini 1.5 Pro 2M-టోకెన్ కాంటెక్స్ట్ వరకు విస్తరిస్తుంది — పరిశ్రమలో అతి పెద్దది — RAG లేకుండా పూర్తి కోడ్బేస్లను లేదా పుస్తక-పరిమాణ డాక్యుమెంట్లను ఒకే ప్రాంప్ట్లో సరిపోయేలా చేస్తుంది. నేటివ్ మల్టీమోడల్ ఇన్పుట్ (ఇమేజ్, ఆడియో, వీడియో) మరియు మాన్యువల్ TTLతో స్పష్టమైన కాంటెక్స్ట్ క్యాషింగ్ విభేదకాలను పూర్తి చేస్తాయి.
కోడ్ వాక్త్రూ
ఇప్పుడు మూడు ప్రొవైడర్ల టియర్లు, కాంటెక్స్ట్ విండోలు, మరియు క్యాష్-డిస్కౌంట్ యంత్రాంగాలు మీ దృష్టిలో ఉన్నాయి కాబట్టి, కింది స్నిప్పెట్ వాటిని ఒక నిర్ణయ సాధనంలో కలుపుతుంది: ఒక వర్క్లోడ్ యొక్క ఇన్పుట్/అవుట్పుట్ టోకెన్ వాల్యూమ్లను మరియు క్యాష్ హిట్ రేటు అంచనాను తీసుకుని, ప్రతి ప్రొవైడర్ టియర్కు అంచనా నెలవారీ ఖర్చును ముద్రించే ఒక చిన్న కాస్ట్ ఎస్టిమేటర్, తద్వారా మీరు అంచనాల ఆధారంగా కాకుండా సంఖ్యల ఆధారంగా ఎంచుకోగలరు.
Code snippetpython
1from dataclasses import dataclass 2 3@dataclass(frozen=True) 4class Tier: 5 provider: str 6 name: str 7 input_per_mtok: float # USD per million input tokens 8 output_per_mtok: float # USD per million output tokens 9 cache_discount: float # fraction off input on cache hit (0.0-1.0) 10 context_tokens: int 11 12TIERS = [ 13 Tier("anthropic", "claude-3.5-sonnet", 3.00, 15.00, 0.90, 200_000), 14 Tier("anthropic", "claude-3.5-haiku", 0.25, 1.25, 0.90, 200_000), 15 Tier("openai", "gpt-4o", 2.50, 10.00, 0.50, 128_000), 16 Tier("openai", "gpt-4o-mini", 0.15, 0.60, 0.50, 128_000), 17 Tier("google", "gemini-2.0-flash", 0.075, 0.30, 0.75, 1_000_000), 18 Tier("google", "gemini-1.5-pro", 1.25, 5.00, 0.75, 2_000_000), 19] 20 21def monthly_cost(tier: Tier, input_mtok: float, output_mtok: float, 22 cache_hit_rate: float) -> float: 23 cached_in = input_mtok * cache_hit_rate 24 fresh_in = input_mtok * (1 - cache_hit_rate) 25 input_cost = (fresh_in + cached_in * (1 - tier.cache_discount)) * tier.input_per_mtok 26 return input_cost + output_mtok * tier.output_per_mtok 27 28def rank_for_workload(input_mtok: float, output_mtok: float, 29 cache_hit_rate: float, min_context: int) -> list[tuple[Tier, float]]: 30 eligible = [t for t in TIERS if t.context_tokens >= min_context] 31 return sorted(((t, monthly_cost(t, input_mtok, output_mtok, cache_hit_rate)) 32 for t in eligible), key=lambda x: x[1]) 33 34# Example: RAG chat — 500 Mtok in, 50 Mtok out, 70% cache hit, needs 128K ctx. 35for tier, cost in rank_for_workload(500, 50, 0.70, 128_000): 36 print(f"{tier.provider:10s} {tier.name:22s} ${cost:>10,.0f}/mo")
మీ వర్క్లోడ్ యొక్క వాస్తవ ఇన్పుట్/అవుట్పుట్ టోకెన్ వాల్యూమ్లు మరియు క్యాష్ హిట్ రేటు కోసం దీన్ని నడిపినప్పుడు ప్రతి టియర్కు నెలవారీ ఖర్చు అంచనా వచ్చి, అత్యంత చౌకైన అర్హత గల టియర్ మీ లేటెన్సీ మరియు సామర్థ్య అవసరాలకు సరిపోయినప్పుడు పని పూర్తయినట్లు. అత్యంత చౌకైన టియర్ నాణ్యతలో తక్కువగా ఉంటే, తదుపరి పరిమితి (రీజనింగ్ సామర్థ్యం, మల్టీమోడల్, స్ట్రక్చర్డ్ అవుట్పుట్) ఆధారంగా మళ్లీ ర్యాంక్ చేసి, దాన్ని దాటే అత్యంత చౌకైన టియర్ను ఎంచుకోండి.
కోసం ఆచరణలో
మీరు ఇప్పుడే చూసిన కాస్ట్ ఎస్టిమేటర్ ఆధారంగా, అదే మోడల్ మరియు టియర్ పోలిక ప్రొవైడర్ల మధ్య సాధారణీకరించబడుతుంది — కానీ ఎంపికను నిర్ణయించే వర్క్లోడ్ నమూనా డిసిప్లిన్-నిర్దిష్టం. కింది ఓవర్లే మీ పాత్రకు ప్రొవైడర్ ఎంపిక ఎలా ఉంటుందో చూపుతుంది.
చేయవలసినవి మరియు చేయకూడనివి
ప్రొవైడర్ ఎంపికను మీ డిసిప్లిన్ వర్క్లోడ్కు ఇప్పుడే సరిపోయేలా చేసిన తర్వాత, కింది నియమాలు ఆ ఎంపికను స్థిరంగా చౌకగా మరియు తిరిగి మార్చుకోగలిగేలా ఉంచే చర్యలను — మరియు బిల్లును నిశ్శబ్దంగా పెంచే ఉచ్చులను — సంక్షిప్తంగా అందిస్తాయి.
చేయవలసినవి
- వాస్తవ టోకెన్ వాల్యూమ్లపై ఖర్చును మోడల్ చేయండి — ఒక వారం ప్రొడక్షన్ లాగ్లను తీసి, ప్రతి రిక్వెస్ట్కు సగటు ఇన్పుట్/అవుట్పుట్ టోకెన్లను మరియు క్యాష్-హిట్ అయ్యే ప్రిఫిక్స్ పొడవును కొలిచి, ఆ సంఖ్యలను ఎస్టిమేటర్లో పెట్టండి. వెండర్ ధరల పేజీలు మీకు వాస్తవంగా లేని వాల్యూమ్లను ఊహిస్తాయి.
- నాణ్యత ప్రమాణాన్ని దాటే అత్యంత చౌకైన టియర్ను ఎంచుకోండి — ఖర్చు-క్రమంలో ఉన్న జాబితాతో ప్రారంభించి, మీ ఎవాల్ సెట్లో విఫలమయ్యే టియర్లను తొలగించండి. "భద్రత కోసం" అత్యంత సామర్థ్యం గల టియర్ను ఎంచుకోవడమే బృందాలు 5× అధికంగా ఖర్చు చేయడానికి కారణం.
- క్యాష్ హిట్ల కోసం ప్రాంప్ట్ ప్రిఫిక్స్ను డిజైన్ చేయండి — స్థిరమైన కంటెంట్ (సిస్టమ్ ప్రాంప్ట్, రిట్రీవ్ చేసిన డాక్యుమెంట్లు, ఫ్యూ-షాట్ ఉదాహరణలు) మొదట, డైనమిక్ కంటెంట్ (యూజర్ టర్న్) చివర పెట్టండి. Anthropic యొక్క 90% డిస్కౌంట్తో, బాగా క్రమపరిచిన ప్రిఫిక్స్ చాట్ వర్క్లోడ్లలో ఇన్పుట్ ఖర్చును 80%+ తగ్గించగలదు.
చేయకూడనివి
- ఆర్కిటెక్చర్ సమయంలో ఒకే ప్రొవైడర్కు లాక్ అవ్వకండి — ధరలు మరియు సామర్థ్యాలు మారుతున్నప్పుడు ప్రతి త్రైమాసికం వర్క్లోడ్ను మళ్లీ బిడ్ చేయగలిగేలా ప్రొవైడర్ కాల్ను ఒక సన్నని అడాప్టర్ వెనుక ఉంచండి. ఈ పాఠంలో మిలియన్ టోకెన్లకు అత్యంత చౌకైన టియర్ మీ తదుపరి పెర్ఫార్మెన్స్ రివ్యూ ముందే మారుతుంది.
- అవుట్పుట్-టోకెన్ ఖర్చును విస్మరించకండి — ప్రతి ప్రొవైడర్ దగ్గరా అవుట్పుట్ ఇన్పుట్ ధర కంటే 4–5×, కాబట్టి జనరేషన్ పొడవే ఆధిపత్యం చెలాయిస్తుంది. ఒక
max_tokensపరిమితి మరియు "సంక్షిప్తంగా ఉండండి" అనే సిస్టమ్ సూచన తరచుగా ఖర్చు విషయంలో ఏ ప్రొవైడర్ మార్పు కంటే మెరుగ్గా పనిచేస్తాయి. - మీరు ఉపయోగించని కాంటెక్స్ట్కు చెల్లించకండి — Gemini యొక్క 2M విండో ఒక ఫీచర్, డిఫాల్ట్ రిక్వెస్ట్ పరిమాణం కాదు. 20K సరిపోయే చోట 500K-టోకెన్ ప్రాంప్ట్ పంపడం నేరుగా అధిక ఖర్చు; జవాబును కలిగి ఉన్న అతి చిన్న కాంటెక్స్ట్కు రిక్వెస్ట్ను పరిమాణం చేయండి.
A hands-on lab comes with this lesson — real code, in a cloud IDE. Create a free account to run it. No card.
Free account · no card · straight to the lab
Or get the full path — from
Listen to this lesson
Audio overviews of this lesson's labs and its chapter, from GenBodha Bytes.
- Build a Live Provider BenchmarkerLab4 min
- Production Hosted LLM ArchitectureChapter overview3 min
More free lessons in GenAI Inference Engineering
- Ch 1Provider Landscape AnalysisYou are here
- Ch 1Token Economics
- Ch 1Rate Limit Management