Free lesson · GenAI Inference Engineering
ಪ್ರೊವೈಡರ್ ಲ್ಯಾಂಡ್ಸ್ಕೇಪ್ ವಿಶ್ಲೇಷಣೆ
Anthropic, OpenAI ಮತ್ತು Google ನಡುವೆ API ಸಾಮರ್ಥ್ಯಗಳು, ಬೆಲೆ ನಿಗದಿ ಮತ್ತು ಸಾಮರ್ಥ್ಯಗಳ ಬಲಗಳನ್ನು ಹೋಲಿಸಿ
Course: GenAI Inference Engineering · Chapter 1 · Production Hosted LLM Architecture
Free to read — no subscription required.
ಪರಿಚಯ
ಪರ್ಯಾಯಗಳನ್ನು ಸಮೀಕ್ಷೆ ಮಾಡದೆ ಪ್ರೊಡಕ್ಷನ್ ವರ್ಕ್ಲೋಡ್ಗಾಗಿ ಒಂದೇ LLM ಪ್ರೊವೈಡರ್ನ್ನು ಆಯ್ಕೆ ಮಾಡಿದಾಗ, ನೀವು ಸಾಮಾನ್ಯವಾಗಿ 3–10× ಹೆಚ್ಚು ಪಾವತಿಸುತ್ತೀರಿ ಅಥವಾ ಆರು ತಿಂಗಳ ನಂತರ ದುಬಾರಿ ಪುನರ್ಲೇಖನವನ್ನು ಒತ್ತಾಯಿಸುವ ಕಾಂಟೆಕ್ಸ್ಟ್-ವಿಂಡೋ ಮಿತಿಯನ್ನು ಎದುರಿಸುತ್ತೀರಿ. Anthropic, OpenAI ಮತ್ತು Google ಪ್ರತಿಯೊಂದೂ ಪರಸ್ಪರ ಹೊಂದಿಕೆಯಾಗುವ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ನೀಡುತ್ತವೆ, ಆದರೆ ಅವುಗಳ ಬೆಲೆ ರೇಖೆಗಳು, ಕ್ಯಾಶ್ ರಿಯಾಯಿತಿಗಳು, ಕಾಂಟೆಕ್ಸ್ಟ್ ಮಿತಿಗಳು ಮತ್ತು ಟೂಲ್-ಬಳಕೆಯ ಅನುಕೂಲತೆಗಳು ತೀವ್ರವಾಗಿ ಭಿನ್ನವಾಗುತ್ತವೆ — ಮತ್ತು ಆ ವ್ಯತ್ಯಾಸಗಳು ಪ್ರತಿಯೊಂದು ಯಾವ ವರ್ಕ್ಲೋಡ್ಗಳಲ್ಲಿ ಉತ್ತಮವಾಗಿದೆ ಎಂಬುದಕ್ಕೆ ನೇರವಾಗಿ ಸಂಬಂಧಿಸುತ್ತವೆ.
ಈ ಪಾಠದ ಅಂತ್ಯದ ವೇಳೆಗೆ, ಇನ್ಫರೆನ್ಸ್ ಇಂಜಿನಿಯರಿಂಗ್ಗೆ ಮುಖ್ಯವಾದ ಆಯಾಮಗಳಾದ — ಮಾಡೆಲ್ ಟಿಯರ್ಗಳು, ಕಾಂಟೆಕ್ಸ್ಟ್ ವಿಂಡೋ, ಇನ್ಪುಟ್/ಔಟ್ಪುಟ್ ಬೆಲೆ ಮತ್ತು ಕ್ಯಾಶ್ ರಿಯಾಯಿತಿ — ಆಧಾರದ ಮೇಲೆ ಮೂರು ಪ್ರಮುಖ ಫ್ರಾಂಟಿಯರ್ ಪ್ರೊವೈಡರ್ಗಳನ್ನು ಹೋಲಿಸಲು ಮತ್ತು ಸರಳ ವೆಚ್ಚ ಮಾದರಿಯನ್ನು ಬಳಸಿ ನಿರ್ದಿಷ್ಟ ವರ್ಕ್ಲೋಡ್ಗಾಗಿ ಪ್ರೊವೈಡರ್ ಆಯ್ಕೆಯನ್ನು ಸಮರ್ಥಿಸಲು ನೀವು ಸಮರ್ಥರಾಗುತ್ತೀರಿ.
ಪ್ರಮುಖ ಪರಿಭಾಷೆ
- ಫ್ರಾಂಟಿಯರ್ ಮಾಡೆಲ್ — ಪ್ರೊವೈಡರ್ ಪ್ರಸ್ತುತ ಒದಗಿಸುವ ಅತ್ಯುನ್ನತ-ಸಾಮರ್ಥ್ಯದ ಟಿಯರ್ (ಉದಾ. Claude 3.5 Sonnet, GPT-4o, Gemini 1.5 Pro). ನೀವು ಏನು ಮಾಡಬಹುದು ಎಂಬುದರ ಮೇಲಿನ ಮಿತಿಯನ್ನು ನಿಗದಿಪಡಿಸುತ್ತದೆ; ಪ್ರತಿ ಟೋಕನ್ಗೆ ನೀವು ಏನು ಪಾವತಿಸುತ್ತೀರಿ ಎಂಬುದರ ಮೇಲಿನ ಮಿತಿಯನ್ನೂ ನಿಗದಿಪಡಿಸುತ್ತದೆ.
- ಕಾಂಟೆಕ್ಸ್ಟ್ ವಿಂಡೋ — ಒಂದೇ ವಿನಂತಿಯು ಒಳಗೊಳ್ಳಬಹುದಾದ ಗರಿಷ್ಠ ಟೋಕನ್ಗಳ ಸಂಖ್ಯೆ (ಪ್ರಾಂಪ್ಟ್ + ಕಂಪ್ಲೀಷನ್). RAG ಅಥವಾ ಸಾರಾಂಶೀಕರಣದ ಅಗತ್ಯವಿಲ್ಲದೆ ಒಂದು ಟರ್ನ್ನಲ್ಲಿ ಎಷ್ಟು ಹಿಂಪಡೆದ ಅಥವಾ ಹಿಂದಿನ ವಿಷಯವನ್ನು ತುಂಬಬಹುದು ಎಂಬುದನ್ನು ಮಿತಿಗೊಳಿಸುತ್ತದೆ.
- ಪ್ರಾಂಪ್ಟ್ ಕ್ಯಾಶಿಂಗ್ — ಮರು-ಕಳುಹಿಸಿದ ಪ್ರಿಫಿಕ್ಸ್ ಟೋಕನ್ಗಳಿಗೆ ಕಡಿಮೆ ದರವನ್ನು ವಿಧಿಸುವ ಪ್ರತಿ-ಪ್ರೊವೈಡರ್ ವೈಶಿಷ್ಟ್ಯ. Anthropic ಕ್ಯಾಶ್ ಆದ ಇನ್ಪುಟ್ ಮೇಲೆ 90% ವರೆಗೆ ರಿಯಾಯಿತಿ ನೀಡುತ್ತದೆ; OpenAI ಸ್ವಯಂಚಾಲಿತ 50% ರಿಯಾಯಿತಿ ನೀಡುತ್ತದೆ; Google ಹಸ್ತಚಾಲಿತ ಜೀವನಚಕ್ರದೊಂದಿಗೆ ಸ್ಪಷ್ಟ ಕಾಂಟೆಕ್ಸ್ಟ್ ಕ್ಯಾಶಿಂಗ್ ನೀಡುತ್ತದೆ.
- ಟೋಕನ್ ಬೆಲೆ ಅಸಮತೆ — ಪ್ರತಿ ಪ್ರೊವೈಡರ್ನಲ್ಲಿ ಔಟ್ಪುಟ್ ಟೋಕನ್ಗಳು ಇನ್ಪುಟ್ ಟೋಕನ್ಗಳ ಸುಮಾರು 4–5× ವೆಚ್ಚವಾಗುತ್ತವೆ. ಈ ಅನುಪಾತದ ಅರ್ಥವೇನೆಂದರೆ, ಚಾಟ್ ವರ್ಕ್ಲೋಡ್ಗಳಲ್ಲಿ ಪ್ರಾಂಪ್ಟ್ ಉದ್ದವಲ್ಲ, ಜನರೇಷನ್ ಉದ್ದವೇ ಸಾಮಾನ್ಯವಾಗಿ ವೆಚ್ಚದ ಮೇಲೆ ಪ್ರಾಬಲ್ಯ ಹೊಂದಿರುತ್ತದೆ.
- ರೀಸನಿಂಗ್ ಮಾಡೆಲ್ — ಗೋಚರ ಉತ್ತರದ ಮೊದಲು ಹೆಚ್ಚುವರಿ ಗುಪ್ತ "ರೀಸನಿಂಗ್ ಟೋಕನ್ಗಳನ್ನು" ಬಳಸುವ ಟಿಯರ್ (OpenAI o1/o3, Gemini Thinking). ಗಣಿತ/ಕೋಡ್ನಲ್ಲಿ ಹೆಚ್ಚಿನ ನಿಖರತೆ, ಆದರೆ ಆ ಗುಪ್ತ ಟೋಕನ್ಗಳಿಗೆ ಬಿಲ್ ಮಾಡಲಾಗುತ್ತದೆ.
ಪರಿಕಲ್ಪನೆಗಳು
ಮೂರು ಪ್ರೊವೈಡರ್ಗಳು ಅವು ಯಾವುದನ್ನು ಆಪ್ಟಿಮೈಜ್ ಮಾಡುತ್ತವೆ ಎಂಬುದರ ಆಧಾರದ ಮೇಲೆ ಗುಂಪಾಗುತ್ತವೆ: Anthropic ಕ್ಯಾಶ್-ಆಧಾರಿತ ಎಂಟರ್ಪ್ರೈಸ್ ವರ್ಕ್ಲೋಡ್ಗಳಿಗಾಗಿ, OpenAI ವೈಶಿಷ್ಟ್ಯಗಳ ವಿಸ್ತಾರ ಮತ್ತು ರೀಸನಿಂಗ್ ಮಾಡೆಲ್ಗಳಿಗಾಗಿ, Google ಅತಿ ದೀರ್ಘ ಕಾಂಟೆಕ್ಸ್ಟ್ಗಳು ಮತ್ತು ಮಲ್ಟಿಮೋಡಲ್ ಇನ್ಪುಟ್ಗಾಗಿ. ಕೆಳಗಿನ ರೇಖಾಚಿತ್ರವು ಟಿಯರ್ಗಳನ್ನು ಮತ್ತು ಪ್ರೊವೈಡರ್ ಆಯ್ಕೆಯನ್ನು ನಿರ್ಧರಿಸುವ ವ್ಯತ್ಯಾಸಕಾರಕಗಳನ್ನು ನಕ್ಷೆ ಮಾಡುತ್ತದೆ.
Anthropic Claude ಟಿಯರ್ಗಳು
ಒಂದೇ 200K-ಟೋಕನ್ ಕಾಂಟೆಕ್ಸ್ಟ್ ವಿಂಡೋದಾದ್ಯಂತ ಮೂರು ಟಿಯರ್ಗಳು. Sonnet ಪ್ರತಿ ಮಿಲಿಯನ್ ಟೋಕನ್ಗಳಿಗೆ $3 ಇನ್ಪುಟ್ / $15 ಔಟ್ಪುಟ್ ದರದಲ್ಲಿ ಡೀಫಾಲ್ಟ್ ಕೆಲಸದ ಕುದುರೆ. Haiku $0.25 / $1.25 ಕ್ಕೆ ಇಳಿಯುತ್ತದೆ — ಗರಿಷ್ಠ ರೀಸನಿಂಗ್ಗಿಂತ ಲೇಟೆನ್ಸಿ ಮತ್ತು ಪ್ರಮಾಣ ಹೆಚ್ಚು ಮುಖ್ಯವಾದಾಗ ಅತ್ಯಂತ ಅಗ್ಗದ ಗಂಭೀರ ಟಿಯರ್. Opus Sonnet ಸ್ಪಷ್ಟವಾಗಿ ಕಡಿಮೆ ಕಾರ್ಯಕ್ಷಮತೆ ತೋರಿಸುವ ಕಾರ್ಯಗಳಿಗಾಗಿ $15 / $75 ದರದ ಪ್ರೀಮಿಯಂ ಟಿಯರ್. ಪ್ರಮುಖ ವ್ಯತ್ಯಾಸಕಾರಕವೆಂದರೆ ಕ್ಯಾಶ್ ಆದ ಇನ್ಪುಟ್ ಮೇಲೆ 90% ವರೆಗೆ ರಿಯಾಯಿತಿಯೊಂದಿಗೆ ಪ್ರಾಂಪ್ಟ್ ಕ್ಯಾಶಿಂಗ್ — ಮಾರುಕಟ್ಟೆಯಲ್ಲಿನ ಅತ್ಯಂತ ತೀವ್ರ ಕ್ಯಾಶ್ ರಿಯಾಯಿತಿ — ಇದು ಒಂದೇ ಸಿಸ್ಟಮ್ ಪ್ರಾಂಪ್ಟ್ ಮತ್ತು ಡಾಕ್ಯುಮೆಂಟ್ ಸೆಟ್ ಟರ್ನ್ಗಳಾದ್ಯಂತ ಪುನರಾವರ್ತನೆಯಾಗುವ ರಿಟ್ರೀವಲ್-ಆಗ್ಮೆಂಟೆಡ್ ಚಾಟ್ಗೆ Anthropic ನನ್ನು ಪ್ರಬಲವಾಗಿಸುತ್ತದೆ.
OpenAI GPT ಮತ್ತು ರೀಸನಿಂಗ್ ಟಿಯರ್ಗಳು
GPT-4o $2.50 / $10 ದರದಲ್ಲಿ 128K ಕಾಂಟೆಕ್ಸ್ಟ್ ಹೊಂದಿರುವ ಫ್ಲ್ಯಾಗ್ಶಿಪ್ ಮಲ್ಟಿಮೋಡಲ್ ಮಾಡೆಲ್. GPT-4o-mini $0.15 / $0.60 ದರದಲ್ಲಿ ಹೆಚ್ಚಿನ ಫ್ರಾಂಟಿಯರ್-ಅಲ್ಲದ ವರ್ಕ್ಲೋಡ್ಗಳಿಗೆ ಬೆಲೆ-ಕಾರ್ಯಕ್ಷಮತೆಯ ಸೂಕ್ತ ಬಿಂದು. o1 / o3 ರೀಸನಿಂಗ್ ಮಾಡೆಲ್ಗಳು ನೀವು ಇನ್ನೂ ಪಾವತಿಸಬೇಕಾದ ಗುಪ್ತ ರೀಸನಿಂಗ್ ಟೋಕನ್ಗಳನ್ನು ಬಳಸಿ ಗಣಿತ, ಕೋಡ್ ಮತ್ತು ಬಹು-ಹಂತದ ತರ್ಕದಲ್ಲಿ ನಿಖರತೆಗಾಗಿ ಲೇಟೆನ್ಸಿಯನ್ನು ವಿನಿಮಯ ಮಾಡಿಕೊಳ್ಳುತ್ತವೆ. OpenAI ನ ವಿಶಿಷ್ಟ ನಡೆಗಳು: ಯಾವುದೇ ಕೋಡ್ ಬದಲಾವಣೆಗಳಿಲ್ಲದೆ ಸ್ವಯಂಚಾಲಿತ 50% ಕ್ಯಾಶ್ ರಿಯಾಯಿತಿ, 24-ಗಂಟೆಗಳ ಟರ್ನ್ಅರೌಂಡ್ಗಾಗಿ 50% ರಿಯಾಯಿತಿಯ Batch API, ಮತ್ತು ನಿರ್ಬಂಧಿತ ಡಿಕೋಡಿಂಗ್ ಮೂಲಕ JSON-ಸ್ಕೀಮಾ ಅನುಸರಣೆಯನ್ನು ಖಾತರಿಪಡಿಸುವ Structured Outputs (ಕೋಡ್ ವಾಕ್ಥ್ರೂ ನೋಡಿ).
Google Gemini ದೀರ್ಘ-ಕಾಂಟೆಕ್ಸ್ಟ್ ಟಿಯರ್ಗಳು
Gemini 2.0 Flash $0.075 / $0.30 ದರದಲ್ಲಿ 1M-ಟೋಕನ್ ಕಾಂಟೆಕ್ಸ್ಟ್ನೊಂದಿಗೆ ಮಾರುಕಟ್ಟೆಯಲ್ಲಿನ ಅತ್ಯಂತ ಅಗ್ಗದ ಗಂಭೀರ ಫ್ರಾಂಟಿಯರ್ ಮಾಡೆಲ್. Gemini 1.5 Pro $1.25 / $5.00 ದರದಲ್ಲಿ 2M-ಟೋಕನ್ ಕಾಂಟೆಕ್ಸ್ಟ್ಗೆ ವಿಸ್ತರಿಸುತ್ತದೆ — ಉದ್ಯಮದಲ್ಲೇ ಅತಿ ದೊಡ್ಡದು — RAG ಇಲ್ಲದೆ ಸಂಪೂರ್ಣ ಕೋಡ್ಬೇಸ್ಗಳನ್ನು ಅಥವಾ ಪುಸ್ತಕ-ಗಾತ್ರದ ಡಾಕ್ಯುಮೆಂಟ್ಗಳನ್ನು ಒಂದೇ ಪ್ರಾಂಪ್ಟ್ನಲ್ಲಿ ಹೊಂದಿಸಲು ನಿಮಗೆ ಅವಕಾಶ ನೀಡುತ್ತದೆ. ಸ್ಥಳೀಯ ಮಲ್ಟಿಮೋಡಲ್ ಇನ್ಪುಟ್ (ಚಿತ್ರ, ಆಡಿಯೋ, ವಿಡಿಯೋ) ಮತ್ತು ಹಸ್ತಚಾಲಿತ TTL ನೊಂದಿಗೆ ಸ್ಪಷ್ಟ ಕಾಂಟೆಕ್ಸ್ಟ್ ಕ್ಯಾಶಿಂಗ್ ವ್ಯತ್ಯಾಸಕಾರಕಗಳನ್ನು ಪೂರ್ಣಗೊಳಿಸುತ್ತವೆ.
ಕೋಡ್ ವಾಕ್ಥ್ರೂ
ಈಗ ಮೂರು ಪ್ರೊವೈಡರ್ಗಳ ಟಿಯರ್ಗಳು, ಕಾಂಟೆಕ್ಸ್ಟ್ ವಿಂಡೋಗಳು ಮತ್ತು ಕ್ಯಾಶ್-ರಿಯಾಯಿತಿ ಕಾರ್ಯವಿಧಾನಗಳು ನಿಮ್ಮ ಮುಂದಿರುವಾಗ, ಕೆಳಗಿನ ಸ್ನಿಪ್ಪೆಟ್ ಅವುಗಳನ್ನು ಒಂದು ನಿರ್ಧಾರ ಸಾಧನವಾಗಿ ಜೋಡಿಸುತ್ತದೆ: ವರ್ಕ್ಲೋಡ್ನ ಇನ್ಪುಟ್/ಔಟ್ಪುಟ್ ಟೋಕನ್ ಪ್ರಮಾಣಗಳು ಮತ್ತು ಕ್ಯಾಶ್ ಹಿಟ್ ದರದ ಅಂದಾಜನ್ನು ತೆಗೆದುಕೊಂಡು, ಪ್ರತಿ ಪ್ರೊವೈಡರ್ ಟಿಯರ್ಗೆ ನಿರೀಕ್ಷಿತ ಮಾಸಿಕ ವೆಚ್ಚವನ್ನು ಮುದ್ರಿಸುವ ಸಣ್ಣ ವೆಚ್ಚ ಅಂದಾಜುಕಾರ, ಇದರಿಂದ ನೀವು ಊಹೆಗಳ ಮೇಲಲ್ಲ, ಸಂಖ್ಯೆಗಳ ಮೇಲೆ ಆಯ್ಕೆ ಮಾಡಬಹುದು.
Code snippetpython
1from dataclasses import dataclass 2 3@dataclass(frozen=True) 4class Tier: 5 provider: str 6 name: str 7 input_per_mtok: float # USD per million input tokens 8 output_per_mtok: float # USD per million output tokens 9 cache_discount: float # fraction off input on cache hit (0.0-1.0) 10 context_tokens: int 11 12TIERS = [ 13 Tier("anthropic", "claude-3.5-sonnet", 3.00, 15.00, 0.90, 200_000), 14 Tier("anthropic", "claude-3.5-haiku", 0.25, 1.25, 0.90, 200_000), 15 Tier("openai", "gpt-4o", 2.50, 10.00, 0.50, 128_000), 16 Tier("openai", "gpt-4o-mini", 0.15, 0.60, 0.50, 128_000), 17 Tier("google", "gemini-2.0-flash", 0.075, 0.30, 0.75, 1_000_000), 18 Tier("google", "gemini-1.5-pro", 1.25, 5.00, 0.75, 2_000_000), 19] 20 21def monthly_cost(tier: Tier, input_mtok: float, output_mtok: float, 22 cache_hit_rate: float) -> float: 23 cached_in = input_mtok * cache_hit_rate 24 fresh_in = input_mtok * (1 - cache_hit_rate) 25 input_cost = (fresh_in + cached_in * (1 - tier.cache_discount)) * tier.input_per_mtok 26 return input_cost + output_mtok * tier.output_per_mtok 27 28def rank_for_workload(input_mtok: float, output_mtok: float, 29 cache_hit_rate: float, min_context: int) -> list[tuple[Tier, float]]: 30 eligible = [t for t in TIERS if t.context_tokens >= min_context] 31 return sorted(((t, monthly_cost(t, input_mtok, output_mtok, cache_hit_rate)) 32 for t in eligible), key=lambda x: x[1]) 33 34# Example: RAG chat — 500 Mtok in, 50 Mtok out, 70% cache hit, needs 128K ctx. 35for tier, cost in rank_for_workload(500, 50, 0.70, 128_000): 36 print(f"{tier.provider:10s} {tier.name:22s} ${cost:>10,.0f}/mo")
ನಿಮ್ಮ ವರ್ಕ್ಲೋಡ್ನ ನಿಜವಾದ ಇನ್ಪುಟ್/ಔಟ್ಪುಟ್ ಟೋಕನ್ ಪ್ರಮಾಣಗಳು ಮತ್ತು ಕ್ಯಾಶ್ ಹಿಟ್ ದರಕ್ಕಾಗಿ ಇದನ್ನು ಚಲಾಯಿಸಿದಾಗ ಪ್ರತಿ ಟಿಯರ್ಗೆ ಮಾಸಿಕ ವೆಚ್ಚದ ಅಂದಾಜು ದೊರೆತು, ಅತ್ಯಂತ ಅಗ್ಗದ ಅರ್ಹ ಟಿಯರ್ ನಿಮ್ಮ ಲೇಟೆನ್ಸಿ ಮತ್ತು ಸಾಮರ್ಥ್ಯದ ಅವಶ್ಯಕತೆಗಳಿಗೆ ಹೊಂದಿಕೆಯಾದಾಗ ಕೆಲಸ ಪೂರ್ಣಗೊಂಡಿದೆ. ಅತ್ಯಂತ ಅಗ್ಗದ ಟಿಯರ್ ಗುಣಮಟ್ಟದಲ್ಲಿ ಕಡಿಮೆ ಬಿದ್ದರೆ, ಮುಂದಿನ ನಿರ್ಬಂಧದ ಆಧಾರದ ಮೇಲೆ (ರೀಸನಿಂಗ್ ಸಾಮರ್ಥ್ಯ, ಮಲ್ಟಿಮೋಡಲ್, ಸ್ಟ್ರಕ್ಚರ್ಡ್ ಔಟ್ಪುಟ್) ಮರು-ಶ್ರೇಣೀಕರಿಸಿ ಮತ್ತು ಅದನ್ನು ದಾಟುವ ಅತ್ಯಂತ ಅಗ್ಗದ ಟಿಯರ್ನ್ನು ಆಯ್ಕೆ ಮಾಡಿ.
ಗಾಗಿ ಪ್ರಾಯೋಗಿಕವಾಗಿ
ನೀವು ಈಗಷ್ಟೇ ನೋಡಿದ ವೆಚ್ಚ ಅಂದಾಜುಕಾರದ ಮೇಲೆ ನಿರ್ಮಿಸುತ್ತಾ, ಅದೇ ಮಾಡೆಲ್ ಮತ್ತು ಟಿಯರ್ ಹೋಲಿಕೆ ಪ್ರೊವೈಡರ್ಗಳಾದ್ಯಂತ ಸಾಮಾನ್ಯೀಕರಿಸುತ್ತದೆ — ಆದರೆ ಆಯ್ಕೆಯನ್ನು ನಿರ್ಧರಿಸುವ ವರ್ಕ್ಲೋಡ್ ಮಾದರಿ ವಿಭಾಗ-ನಿರ್ದಿಷ್ಟವಾಗಿದೆ. ಕೆಳಗಿನ ಓವರ್ಲೇ ನಿಮ್ಮ ಪಾತ್ರಕ್ಕೆ ಪ್ರೊವೈಡರ್ ಆಯ್ಕೆ ಹೇಗೆ ಕಾಣುತ್ತದೆ ಎಂಬುದನ್ನು ತೋರಿಸುತ್ತದೆ.
ಮಾಡಬೇಕಾದವು ಮತ್ತು ಮಾಡಬಾರದವು
ನಿಮ್ಮ ವಿಭಾಗದ ವರ್ಕ್ಲೋಡ್ಗೆ ಪ್ರೊವೈಡರ್ ಆಯ್ಕೆಯನ್ನು ಈಗಷ್ಟೇ ಹೊಂದಿಸಿದ ನಂತರ, ಕೆಳಗಿನ ನಿಯಮಗಳು ಆ ಆಯ್ಕೆಯನ್ನು ಸ್ಥಿರವಾಗಿ ಅಗ್ಗವಾಗಿ ಮತ್ತು ಹಿಂತಿರುಗಿಸಬಹುದಾದಂತೆ ಇರಿಸುವ ನಡೆಗಳನ್ನು — ಮತ್ತು ಬಿಲ್ನ್ನು ಸದ್ದಿಲ್ಲದೆ ಹೆಚ್ಚಿಸುವ ಬಲೆಗಳನ್ನು — ಸಾರಾಂಶಿಸುತ್ತವೆ.
ಮಾಡಬೇಕಾದವು
- ನಿಜವಾದ ಟೋಕನ್ ಪ್ರಮಾಣಗಳ ಮೇಲೆ ವೆಚ್ಚವನ್ನು ಮಾದರಿ ಮಾಡಿ — ಒಂದು ವಾರದ ಪ್ರೊಡಕ್ಷನ್ ಲಾಗ್ಗಳನ್ನು ಪಡೆದು, ಪ್ರತಿ ವಿನಂತಿಗೆ ಸರಾಸರಿ ಇನ್ಪುಟ್/ಔಟ್ಪುಟ್ ಟೋಕನ್ಗಳು ಮತ್ತು ಕ್ಯಾಶ್-ಹಿಟ್ ಆಗಬಹುದಾದ ಪ್ರಿಫಿಕ್ಸ್ ಉದ್ದವನ್ನು ಅಳೆಯಿರಿ, ನಂತರ ಆ ಸಂಖ್ಯೆಗಳನ್ನು ಅಂದಾಜುಕಾರಕ್ಕೆ ಹಾಕಿ. ವೆಂಡರ್ ಬೆಲೆ ಪುಟಗಳು ನೀವು ನಿಜವಾಗಿ ಹೊಂದಿಲ್ಲದ ಪ್ರಮಾಣಗಳನ್ನು ಊಹಿಸುತ್ತವೆ.
- ಗುಣಮಟ್ಟದ ಮಾನದಂಡವನ್ನು ದಾಟುವ ಅತ್ಯಂತ ಅಗ್ಗದ ಟಿಯರ್ನ್ನು ಆಯ್ಕೆ ಮಾಡಿ — ವೆಚ್ಚ-ವಿಂಗಡಿಸಿದ ಪಟ್ಟಿಯಿಂದ ಆರಂಭಿಸಿ, ನಂತರ ನಿಮ್ಮ ಇವಾಲ್ ಸೆಟ್ನಲ್ಲಿ ವಿಫಲವಾಗುವ ಟಿಯರ್ಗಳನ್ನು ಹೊರಗಿಡಿ. "ಸುರಕ್ಷಿತವಾಗಿರಲು" ಅತ್ಯಂತ ಸಮರ್ಥ ಟಿಯರ್ನ್ನು ಆಯ್ಕೆ ಮಾಡುವುದೇ ತಂಡಗಳು 5× ಹೆಚ್ಚು ಖರ್ಚು ಮಾಡುವ ರೀತಿ.
- ಕ್ಯಾಶ್ ಹಿಟ್ಗಳಿಗಾಗಿ ಪ್ರಾಂಪ್ಟ್ ಪ್ರಿಫಿಕ್ಸ್ನ್ನು ವಿನ್ಯಾಸಗೊಳಿಸಿ — ಸ್ಥಿರ ವಿಷಯವನ್ನು (ಸಿಸ್ಟಮ್ ಪ್ರಾಂಪ್ಟ್, ಹಿಂಪಡೆದ ಡಾಕ್ಯುಮೆಂಟ್ಗಳು, ಫ್ಯೂ-ಶಾಟ್ ಉದಾಹರಣೆಗಳು) ಮೊದಲು ಮತ್ತು ಡೈನಾಮಿಕ್ ವಿಷಯವನ್ನು (ಬಳಕೆದಾರ ಟರ್ನ್) ಕೊನೆಯಲ್ಲಿ ಇರಿಸಿ. Anthropic ನ 90% ರಿಯಾಯಿತಿಯೊಂದಿಗೆ, ಸರಿಯಾಗಿ ಕ್ರಮಗೊಳಿಸಿದ ಪ್ರಿಫಿಕ್ಸ್ ಚಾಟ್ ವರ್ಕ್ಲೋಡ್ಗಳಲ್ಲಿ ಇನ್ಪುಟ್ ವೆಚ್ಚವನ್ನು 80%+ ಕಡಿತಗೊಳಿಸಬಹುದು.
ಮಾಡಬಾರದವು
- ಆರ್ಕಿಟೆಕ್ಚರ್ ಸಮಯದಲ್ಲಿ ಒಂದೇ ಪ್ರೊವೈಡರ್ಗೆ ಬಂಧಿಸಿಕೊಳ್ಳಬೇಡಿ — ಬೆಲೆ ಮತ್ತು ಸಾಮರ್ಥ್ಯಗಳು ಬದಲಾದಂತೆ ಪ್ರತಿ ತ್ರೈಮಾಸಿಕದಲ್ಲಿ ವರ್ಕ್ಲೋಡ್ನ್ನು ಮರು-ಬಿಡ್ ಮಾಡಲು ಸಾಧ್ಯವಾಗುವಂತೆ ಪ್ರೊವೈಡರ್ ಕಾಲ್ನ್ನು ತೆಳುವಾದ ಅಡಾಪ್ಟರ್ನ ಹಿಂದೆ ಇರಿಸಿ. ಈ ಪಾಠದಲ್ಲಿನ ಪ್ರತಿ-ಮಿಲಿಯನ್-ಟೋಕನ್ಗೆ ಅತ್ಯಂತ ಅಗ್ಗದ ಟಿಯರ್ ನಿಮ್ಮ ಮುಂದಿನ ಪರ್ಫಾರ್ಮೆನ್ಸ್ ರಿವ್ಯೂ ಮೊದಲೇ ಬದಲಾಗುತ್ತದೆ.
- ಔಟ್ಪುಟ್-ಟೋಕನ್ ವೆಚ್ಚವನ್ನು ನಿರ್ಲಕ್ಷಿಸಬೇಡಿ — ಪ್ರತಿ ಪ್ರೊವೈಡರ್ನಲ್ಲಿ ಔಟ್ಪುಟ್ ಇನ್ಪುಟ್ ಬೆಲೆಯ 4–5× ಆಗಿರುತ್ತದೆ, ಆದ್ದರಿಂದ ಜನರೇಷನ್ ಉದ್ದವೇ ಪ್ರಾಬಲ್ಯ ಹೊಂದಿರುತ್ತದೆ.
max_tokensಮಿತಿ ಮತ್ತು "ಸಂಕ್ಷಿಪ್ತವಾಗಿರಿ" ಎಂಬ ಸಿಸ್ಟಮ್ ಸೂಚನೆ ವೆಚ್ಚದ ವಿಷಯದಲ್ಲಿ ಯಾವುದೇ ಪ್ರೊವೈಡರ್ ಬದಲಾವಣೆಯನ್ನು ಹೆಚ್ಚಾಗಿ ಮೀರಿಸುತ್ತವೆ. - ನೀವು ಬಳಸದ ಕಾಂಟೆಕ್ಸ್ಟ್ಗೆ ಪಾವತಿಸಬೇಡಿ — Gemini ನ 2M ವಿಂಡೋ ಒಂದು ವೈಶಿಷ್ಟ್ಯ, ಡೀಫಾಲ್ಟ್ ವಿನಂತಿ ಗಾತ್ರವಲ್ಲ. 20K ಸಾಕಾಗುವಾಗ 500K-ಟೋಕನ್ ಪ್ರಾಂಪ್ಟ್ ಕಳುಹಿಸುವುದು ನೇರ ಅತಿವೆಚ್ಚ; ಉತ್ತರವನ್ನು ಒಳಗೊಂಡಿರುವ ಅತ್ಯಂತ ಚಿಕ್ಕ ಕಾಂಟೆಕ್ಸ್ಟ್ಗೆ ವಿನಂತಿಯನ್ನು ಗಾತ್ರಗೊಳಿಸಿ.
A hands-on lab comes with this lesson — real code, in a cloud IDE. Create a free account to run it. No card.
Free account · no card · straight to the lab
Or get the full path — from
Listen to this lesson
Audio overviews of this lesson's labs and its chapter, from GenBodha Bytes.
- Build a Live Provider BenchmarkerLab4 min
- Production Hosted LLM ArchitectureChapter overview3 min
More free lessons in GenAI Inference Engineering
- Ch 1Provider Landscape AnalysisYou are here
- Ch 1Token Economics
- Ch 1Rate Limit Management