מחשבון עלויות
LLM API
הדביקו פרומפט לדוגמה או הקלידו ספירות טוקנים, קבעו את הנפח, וראו כמה עולה חודש ב-Claude, GPT, Gemini, Llama ו-DeepSeek; זה לצד זה, עם כל מחיר ניתן לעריכה.
כמה יעלה חודש של קריאות?
אומדן טוקנים = תווים / 4. מנגנוני טוקניזציה אמיתיים משתנים לפי מודל ושפה, בדרך כלל ב-10-15%; טוב לתקצוב, לא לחשבוניות.
| מודל | קלט $/1M | פלט $/1M | עלות / חודש | השוואה | אם זה יגדל פי 10 |
|---|
כשה-AI שלכם בונה אתר, Yetty מעלה אותו לאוויר ונשארת מחוברת דרך MCP; ה-AI שלכם ממשיך לערוך, לפרסם ולקרוא לידים.
איך חיוב LLM
באמת עובד
שני מונים, לא אחד
קלט ופלט מחויבים בנפרד, ופלט בדרך כלל עולה פי 5 לטוקן. מודל פטפטן בתוכנית זולה יכול לייצר חשבון גדול יותר ממודל תמציתי בתוכנית יקרה.
אתם שולחים מחדש את כל השיחה
ה-API הוא חסר מצב: כל תור שולח מחדש את מלוא ההיסטוריה כקלט. שיחה בת 20 תורים משלמת על תור 1 עשרים פעם; לכן שיחות ארוכות מתייקרות מהר.
מטמון הוא המנוף הגדול
קידומת פרומפט יציבה (פרומפט מערכת, מסמכים, כלים) ניתנת לשמירה במטמון; הספקים אז מחייבים על קלט מהמטמון בהנחה כבדה, לרוב סביב 90%. הפעילו אותו למעלה כדי לראות את ההשפעה.
גודל המודל הוא טווח של פי 25
בין מודל קטן לדגם דגל אותה קריאה יכולה להיות יקרה פי 25. נתבו קריאות פשוטות (סיווג, חילוץ, עיצוב מחדש) לקטן ושמרו את דגם הדגל לעבודה הקשה.
טוקנים הם לא מילים
אנגלית ממוצעת סביב 4 תווים לטוקן, אבל קוד, JSON ושפות שאינן לטיניות עוברות טוקניזציה כבדה יותר. אותו פרומפט "קצר" בעברית או ביפנית יכול לעלות משמעותית יותר.
ההצלחה היא הסכנה
העלויות גדלות באופן ליניארי עם השימוש; עמודת פי 10 למעלה היא תרחיש "הפיצ׳ר שלנו המריא". תקצבו לזה לפני ההשקה, לא באימייל החשבונית אחריה.
אנשים גם שואלים
כמה עולה Claude API למיליון טוקנים?
נכון לאמצע 2026 התעריפים המובילים הם בערך 5$ למיליון טוקני קלט ו-25$ למיליון טוקני פלט ב-Claude Opus, 3$/15$ ב-Claude Sonnet ו-1$/5$ ב-Claude Haiku. הספקים משנים מחירים ומריצים מבצעים לעיתים קרובות, ובדיוק לכן כל תא מחיר במחשבון הזה ניתן לעריכה; התייחסו לברירות המחדל כנקודת פתיחה והדביקו את המספרים העדכניים מדף התמחור של הספק שלכם.
איך אני מעריך כמה טוקנים יש בטקסט שלי?
כלל אצבע מהיר לאנגלית הוא טוקן אחד לכל 4 תווים, או בערך 750 מילים לכל 1,000 טוקנים. מנגנוני טוקניזציה אמיתיים משתנים לפי מודל ושפה; קוד, כתבים שאינם לטיניים ופורמט חריג יכולים להזיז את הספירה ב-10-15% ואף יותר, אז השתמשו באומדן לתקצוב ובמונה הטוקנים של הספק כשצריך חשבון מדויק.
איך אני מפחית את עלויות ה-LLM API שלי?
שלושת המנופים החשובים ביותר: השתמשו במודל קטן יותר לקריאות פשוטות (סיווג וחילוץ כמעט אף פעם לא צריכים דגם דגל), שמרו במטמון את קידומת הפרומפט החוזרת (הספקים מוזילים קלט מהמטמון בכבדות, לרוב סביב 90%), וקצצו את מה שאתם שולחים; פרומפט מערכת קצר יותר והיסטוריה מתומצתת מקטינים את חשבון הקלט בכל בקשה. Batch APIs מוסיפים בדרך כלל עוד כ-50% הנחה למשימות שיכולות לחכות.