پس از اولین آزمایش مستقل، کارشناسان بر سر کلود اپوس 5 جدا شدند

آزمایشکنندگان مستقل کلود اوپوس 5 جدید Anthropic را با امتیاز 159 در یک شاخص توانایی، دو امتیاز کمتر از Claude Fable 5، در حالی که به شدت رکورد بررسی کد آن را تقسیم میکنند، کسب کردند. نکات کلیدی: Epoch AI Claude Opus 5 را در شاخص توانایی خود، در مقابل 161 برای Claude Fable 5، با امتیاز 159 در مهندسی نرم افزار، رتبه بندی کرد. CodeRabbit دقت 39.3 درصدی را در نظرات بررسی عملی ثبت کرد، که از 35.2 درصد پایه بود، اما چهار برابر تعداد nitpick ها را شمارش کرد. آزمایشکنندگان سازمانی در Cognition و Zapier دستاوردهایی را در زمینه اشکالزدایی و اتوماسیون کسبوکار انتها به انتها گزارش کردند. Claude Opus 5 Benchmarks Face Early Scrutiny Anthropic این مدل را روز جمعه عرضه کرد و گفت که با نصف قیمت به هوش مرزی Fable 5 نزدیک می شود و عرضه را به عنوان یک ابزار روزمره به جای یک متخصص قرار می دهد. گلزنان خارجی اکثراً موافق بودند، هر چند نه در حاشیه. Epoch AI امتیاز 159 Opus 5 را در مقابل 161 برای Fable 5 قرار داد و این دو را حتی در مهندسی نرم افزار رتبه بندی کرد. تجزیه و تحلیل مصنوعی مدل را در رتبه اول در معیار کار دانش عاملی خود قرار داد و Fable 5 را با نزدیک به 150 Elo شکست داد و هزینه هر کار را 20٪ کاهش داد. برخی از توسعه دهندگان شاخص قابلیت را عقب انداختند. آنها استدلال کردند که یک نقطه بهبود نسبت به Opus 4.8 قدیمیتر، آنچه را که در استفاده روزانه میبینند، بهشدت دست کم میگیرد. یکی از ارزیابها دریافت که تلاش متوسط در آزمون کدنویسی، تنظیمات بالاتر را شکست.همچنین بخوانید: BitMEX پس از 11 سال بدون خریدار خاموش میشود. احکام بررسی کد تقسیم آزمایشکنندگان CodeRabbit Opus 5 را در برابر تقریباً 100 الگوی خطا برگرفته از درخواستهای کشش منبع باز واقعی، سه پاس در هر پیکربندی، و دقت 39.3 درصد در نظرات قابل اجرا اجرا کرد. این رقم پایه 35.2 درصدی را که توسط بازبینی کننده تولید آن تعیین شده بود شکست داد، اما این مدل با اشکالات شناخته شده کمتری روبرو شد و چهار برابر بیشتر نقاط ضعف تولید کرد، مهندسان یادداشت های کم ارزش باید با دست تریاژ کنند. در تلاش پیش فرض، دقت به 26.4 درصد کاهش یافت. این شرکت به این نتیجه رسید که تیمها باید Opus 5 را بهعنوان یک بازبین دوم و دقیقمحور بهجای ارتقای مستقیم خط لولهای که در حال حاضر کار میکند، در نظر بگیرند. کلر وو، که یک ارزیابی هفت مدلی را برای تیمهای محصول انجام میدهد، مدل را درخشان اما آزاردهنده خواند و به یک رگه عصبی و تضاد ادغامی اشاره کرد که صراحتاً از لمس کردن آن امتناع کرد. Anthropic Customers Report Agent Gains Scott Wu، مدیر اجرایی Cognition، گفت که Opus 5 به عملکرد سطح Fable با نصف هزینه در داخل دوین، با قدرت خاصی در اشکال زدایی و تجزیه و تحلیل علت اصلی نزدیک می شود.
عنوان اصلی (انگلیسی): Experts Split Over Claude Opus 5 After The First Independent Tests
مشاهدهی خبر کامل در منبع ↗ بازگشت به Mythosاین خلاصه بهصورت خودکار از کوینمارکتکپ ترجمه شده و ممکن است خطای ماشینی داشته باشد؛ صرفاً جهت اطلاعرسانی است و توصیهی معاملاتی نیست.