خبری درباره‌ی Mythos (MYTH)

پس از اولین آزمایش مستقل، کارشناسان بر سر کلود اپوس 5 جدا شدند

Yellow News ۳ روز پیش خلاصه‌ی فارسی · ۴۸۳ کلمه
پس از اولین آزمایش مستقل، کارشناسان بر سر کلود اپوس 5 جدا شدند

آزمایش‌کنندگان مستقل کلود اوپوس 5 جدید Anthropic را با امتیاز 159 در یک شاخص توانایی، دو امتیاز کمتر از Claude Fable 5، در حالی که به شدت رکورد بررسی کد آن را تقسیم می‌کنند، کسب کردند. نکات کلیدی: Epoch AI Claude Opus 5 را در شاخص توانایی خود، در مقابل 161 برای Claude Fable 5، با امتیاز 159 در مهندسی نرم افزار، رتبه بندی کرد. CodeRabbit دقت 39.3 درصدی را در نظرات بررسی عملی ثبت کرد، که از 35.2 درصد پایه بود، اما چهار برابر تعداد nitpick ها را شمارش کرد. آزمایش‌کنندگان سازمانی در Cognition و Zapier دستاوردهایی را در زمینه اشکال‌زدایی و اتوماسیون کسب‌وکار انتها به انتها گزارش کردند. Claude Opus 5 Benchmarks Face Early Scrutiny Anthropic این مدل را روز جمعه عرضه کرد و گفت که با نصف قیمت به هوش مرزی Fable 5 نزدیک می شود و عرضه را به عنوان یک ابزار روزمره به جای یک متخصص قرار می دهد. گلزنان خارجی اکثراً موافق بودند، هر چند نه در حاشیه. Epoch AI امتیاز 159 Opus 5 را در مقابل 161 برای Fable 5 قرار داد و این دو را حتی در مهندسی نرم افزار رتبه بندی کرد. تجزیه و تحلیل مصنوعی مدل را در رتبه اول در معیار کار دانش عاملی خود قرار داد و Fable 5 را با نزدیک به 150 Elo شکست داد و هزینه هر کار را 20٪ کاهش داد. برخی از توسعه دهندگان شاخص قابلیت را عقب انداختند. آنها استدلال کردند که یک نقطه بهبود نسبت به Opus 4.8 قدیمی‌تر، آنچه را که در استفاده روزانه می‌بینند، به‌شدت دست کم می‌گیرد. یکی از ارزیاب‌ها دریافت که تلاش متوسط ​​در آزمون کدنویسی، تنظیمات بالاتر را شکست.همچنین بخوانید: BitMEX پس از 11 سال بدون خریدار خاموش می‌شود. احکام بررسی کد تقسیم آزمایش‌کنندگان CodeRabbit Opus 5 را در برابر تقریباً 100 الگوی خطا برگرفته از درخواست‌های کشش منبع باز واقعی، سه پاس در هر پیکربندی، و دقت 39.3 درصد در نظرات قابل اجرا اجرا کرد. این رقم پایه 35.2 درصدی را که توسط بازبینی کننده تولید آن تعیین شده بود شکست داد، اما این مدل با اشکالات شناخته شده کمتری روبرو شد و چهار برابر بیشتر نقاط ضعف تولید کرد، مهندسان یادداشت های کم ارزش باید با دست تریاژ کنند. در تلاش پیش فرض، دقت به 26.4 درصد کاهش یافت. این شرکت به این نتیجه رسید که تیم‌ها باید Opus 5 را به‌عنوان یک بازبین دوم و دقیق‌محور به‌جای ارتقای مستقیم خط لوله‌ای که در حال حاضر کار می‌کند، در نظر بگیرند. کلر وو، که یک ارزیابی هفت مدلی را برای تیم‌های محصول انجام می‌دهد، مدل را درخشان اما آزاردهنده خواند و به یک رگه عصبی و تضاد ادغامی اشاره کرد که صراحتاً از لمس کردن آن امتناع کرد. Anthropic Customers Report Agent Gains Scott Wu، مدیر اجرایی Cognition، گفت که Opus 5 به عملکرد سطح Fable با نصف هزینه در داخل دوین، با قدرت خاصی در اشکال زدایی و تجزیه و تحلیل علت اصلی نزدیک می شود.

عنوان اصلی (انگلیسی): Experts Split Over Claude Opus 5 After The First Independent Tests

مشاهده‌ی خبر کامل در منبع ↗ بازگشت به Mythos

این خلاصه به‌صورت خودکار از کوین‌مارکت‌کپ ترجمه شده و ممکن است خطای ماشینی داشته باشد؛ صرفاً جهت اطلاع‌رسانی است و توصیه‌ی معاملاتی نیست.