מוצר · 26 בספטמבר 2026
Anthropic השיקה את Opus 5.5 עם ביצועים גבוהים ועלויות נמוכות יותר
חברת Anthropic השיקה את Claude Opus 5.5, הדגם הראשון מסדרת Claude 5.5, המציע יכולות דומות לאלו של Claude Fable 5.1 אך בעלות נמוכה יותר. כפי שדיווח Techsauce, הדגם החדש מפחית את עלויות השימוש בכ-40% במשימות כלליות בהשוואה ל-Claude Opus 5.
הדגם עבר בדיקות של גופים חיצוניים, ביניהם Frontier Design ו-METR, כחלק מגישת החברה לניהול קצב פיתוח בינה מלאכותית. בבדיקות כתיבת קוד מסוג סוכן, Opus 5.5 רשם תוצאה של 66.4% ב-Terminal-Bench 4.0, תוצאה הגבוהה יותר מזו של Fable 5.1, Opus 5 ו-GPT-6 Astra של OpenAI. כמו כן, הוא השיג 57.8% ב-CursorBench 4.0, לעומת 41.7% של GPT-5.6 Sol.
בתחומי עבודת הידע, הדגם רשם 1,846 נקודות Elo ב-GDPval-AA v2.1, מה שמעמיד אותו מעל Fable 5.1, Opus 5 ו-GPT-6 Astra. הוא הוביל גם ב-OSWorld 2.0 בבקרת מחשב עם 81.8% וב-Humanity's Last Exam עם 67.7%. עם זאת, GPT-6 Astra עדיין עולה עליו ב-AutomationBench למשימות עסקיות וב-Terminal-Bench-Science למחקר מדעי. Anthropic ציינה כי הגבלות בטיחות שהופעלו במהלך הבדיקות עשויות להסביר את התוצאות הנמוכות יותר בתחומי הסייבר והביולוגיה.
מבחינת עלויות, מחיר הקלט עומד על 4 דולרים ומחיר הפלט על 20 דולרים למיליון טוקנים, ירידה של 20%. עלויות קריאת מטמון ירדו ב-60% ל-0.20 דולרים, ועלויות כתיבת מטמון ירדו מ-6.25 ל-5 דולרים. הדגם מהיר יותר ב-30% מ-Opus 5, וכולל "מצב מהיר" ב-Claude Code וב-Claude Platform המאיץ את העבודה עד פי 2.5 בעלות של 8 דולרים לקלט ו-40 דולרים לפלט למיליון טוקנים. משתמשי חבילות Pro, Max, Team ו-Enterprise ייהנו ממכסות שימוש מוגדלות ואפשרות לאיפוס מגבלות קצב.
הדגם מפגין יעילות גבוהה בפרויקטים רחבי היקף. בבדיקה אחת, הוא סרק ותיקן בסיס קוד של 200,000 שורות בפחות מ-3 שעות, בעוד ש-Opus 5 נזקק ליותר מ-20 שעות. בניסוי המרת תוכנת HAProxy משפת C לשפת Rust, Opus 5.5 השלים את המשימה ב-9.5 שעות, מהיר יותר מ-Fable 5.1 שסיימה ב-12 שעות, ובעלות נמוכה ב-51%.
לשיפור הבטיחות, Opus 5.5 כולל מערכת סיווג לבדיקת פעולות, סביבת ארגז חול בקוד פתוח ומערכת לבדיקת פרצות בקוד. הוא מראה עמידות גבוהה יותר להזרקת הנחיות, ובבדיקות של Gray Swan רשם את שיעור ההצלחה הנמוך ביותר של תקיפות יחד עם Fable 5.1.
בתחומי המחקר והפיננסים, הדגם הוכיח דיוק גבוה. בבדיקת כתיבת דוחות רבעוניים, Opus 5.5 עמד בקריטריונים ב-16 מתוך 18 מקרים, בעוד ש-Fable 5.1 ו-Opus 5 לא עמדו באף מקרה. חברת ההשקעות Walleye Capital דיווחה כי הדגם פתר כמעט את כל שאלות ההערכה שלה ואף זיהה ותיקן שגיאות בהנחיות הבדיקה עצמן.
לפי Techsauce.