چکیده
اوپنایآی در ۲۳ آوریل ۲۰۲۶ از GPT-5.5 به عنوان «هوشمندترین و شهودیترین مدل خود تا امروز» رونمایی کرد. این مدل نشاندهندهٔ یک تغییر راهبردی بنیادین است: دیگر یک «مشاور پرحرف» نیست، بلکه یک «مجری عاملمحور» محسوب میشود که میتواند وظایف پیچیده و درهم را به طور مستقل برنامهریزی، اجرا و راستیآزمایی کند.
متن کامل
🧠 عملکرد در معیارهای کلیدی سنجش معیار سنجش آنچه میسنجد نمره GPT-5.5 نمره برای مقایسه Terminal-Bench 2.0 کدنویسی عاملمحور و خط فرمان ٪82.7 Claude Opus 4.7: ٪69.4 SWE-Bench Pro حل مسئله در مخازن واقعی گیتهاب ٪58.6 Claude Opus 4.7: ٪64.3 GDPval کار دانشی در ۴۴ شغل (مالی، حقوق و ...) ٪84.9 Claude Opus 4.7: ٪80.3 OSWorld-Verified کار با محیطهای کامپیوتری ٪78.7 Claude Opus 4.7: ٪78.0 BrowseComp پژوهش پیشرفته وب ٪90.1 (Pro) Gemini 3.1 Pro: ٪85.9 ARC-AGI-2 استدلال خارج از توزیع ٪85.0 رکورد جدید SOTA FrontierMath (سطح ۴) استدلال ریاضی و علمی ٪39.6 (Pro) Claude Opus 4.7: ٪22.9