آنتی ویروس پادویش

نبرد بزرگ هوش مصنوعی: مقایسه جمینای ۳ و گراک ۴.۱ در ۹ آزمون سخت؛ برنده کیست؟

نبرد بزرگ هوش مصنوعی: مقایسه جمینای ۳ و گراک ۴.۱ در ۹ آزمون سخت؛ برنده کیست؟

مدل‌ های هوش مصنوعی جمینای ۳ (Gemini 3) و گراک ۴.۱ (Grok 4.1) در حال حاضر در صدر جدول امتیازات LMArena قرار دارند. این تابلوی امتیازات عمومی، مدل‌ های اصلی هوش مصنوعی امروزی را بر اساس نبردهای واقعی کاربران رتبه‌بندی می‌کند. این پلتفرم توسط LMSYS اداره می‌شود (همان تیمی که پشت Chatbot Arena قرار دارد) و به یکی از قابل‌ اعتمادترین روش‌ ها برای سنجش عملکرد مدل‌ ها در دنیای واقعی تبدیل شده است.

کانال بله زوم تکگیفت کارت

به گزارش بخش اخبار فناوری زوم تک به نقل از Tom’s Guide، آماندا کسول (Amanda Caswell) در این بررسی می‌ نویسد: من جمینای ۳ و گراک ۴.۱ را در ۹ چالش متمایز (شامل پازل‌ های منطقی، وظایف کدنویسی، نویسندگی خلاق و خودشناسی) رو در روی هم قرار دادم تا ببینم هر کدام چگونه از پس نیازهایی که کاربران معمولاً از دستیارهای هوش مصنوعی دارند، برمی‌آیند. نتایج، تفاوت‌ های جالبی را در سبک، عمق و قابلیت اطمینان آشکار می‌کند.

۱. استدلال (Reasoning)

نبرد بزرگ هوش مصنوعی: مقایسه جمینای ۳ و گراک ۴.۱ در ۹ آزمون سخت؛ برنده کیست؟

دستور متنی (Prompt): شما دو طناب دارید. سوختن هر طناب از یک سر تا سر دیگر دقیقاً ۶۰ دقیقه طول می‌کشد، اما آن‌ها با سرعت‌های ناسازگار می‌سوزند (بخش‌های مختلف سریع‌تر یا کندتر می‌سوزند). تنها با استفاده از این دو طناب و یک فندک، چگونه می‌توانید دقیقاً ۴۵ دقیقه را اندازه بگیرید؟

  • جمینای ۳.۰: از سرفصل‌های واضح استفاده کرد و به صراحت اصل ریاضی را بیان نمود، در حالی که پیشنهاد داد پازل دیگری نیز ارائه دهد.
  • گراک ۴.۱: شامل جملات محاوره‌ای‌تری مانند «این ویژگی کلیدی این پازل‌هاست» بود و توضیحات آن کمی طبیعی‌تر جریان داشت.
  • برنده: گراک برنده می‌شود؛ زیرا با تاکید بر اینکه چگونه ناهماهنگی در سوختن خنثی می‌شود، نگرانی مربوط به «سرعت‌های ناسازگار» را بهتر پاسخ داد.

۲. منطق (Logic)

نبرد بزرگ هوش مصنوعی: مقایسه جمینای ۳ و گراک ۴.۱ در ۹ آزمون سخت؛ برنده کیست؟

دستور متنی: در یک روستا، آرایشگر صورت تمام کسانی (و تنها کسانی) را می‌تراشد که خودشان صورتشان را نمی‌تراشند. آیا آرایشگر صورت خودش را می‌تراشد؟ این پارادوکس و آنچه درباره تعاریف خود-ارجاعی (self-referential) آشکار می‌کند را توضیح دهید.

  • جمینای ۳.۰: از سرفصل‌های واضح استفاده کرد و تناقض منطقی را در قالب متعادل «اگر/آنگاه» ارائه داد.
  • گراک ۴.۱: زمینه تاریخی را ارائه کرد و با زبانی قاطع درباره پیامدها، تاکید کرد که چنین آرایشگری وجود ندارد.
  • برنده: جمینای ۳.۰ برنده می‌شود؛ زیرا کمی صیقل‌خورده‌تر و آموزنده‌تر بود.

۳. کدنویسی (Coding)

نبرد بزرگ هوش مصنوعی: مقایسه جمینای ۳ و گراک ۴.۱ در ۹ آزمون سخت؛ برنده کیست؟

دستور متنی: یک تابع پایتون بنویسید که تعیین کند آیا یک صفحه سودوکو داده شده (شبکه ۹x۹ با برخی خانه‌های پر شده و بقیه به عنوان ۰) طبق قوانین سودوکو معتبر است یا خیر. مدیریت حالت‌های خاص (Edge case) را لحاظ کنید و رویکرد خود را توضیح دهید.

  • جمینای ۳.۰: پاسخی آموزشی‌تر با توضیحات دقیق ارائه داد. این پاسخ به دلیل مدیریت جامع حالت‌های خاص برای اهداف یادگیری مفید است.
  • گراک ۴.۱: تغییرات ورودی دنیای واقعی را مدیریت کرد و درخواست را به طور کارآمد و بدون پیچیدگی بیش از حد (over-engineering) انجام داد.
  • برنده: جمینای برنده می‌شود؛ به دلیل گزارش خطای برتر و پشتیبانی از دیباگ با کدی تمیزتر و قابل نگهداری‌تر.

۴. دیباگ کردن (Debugging)

نبرد بزرگ هوش مصنوعی: مقایسه جمینای ۳ و گراک ۴.۱ در ۹ آزمون سخت؛ برنده کیست؟

دستور متنی: این کد را دیباگ کنید و توضیح دهید چه مشکلی دارد: def fib(n): return fib(n-1) + fib(n-2)

  • جمینای ۳.۰: مستقیماً سراغ اصل مطلب رفت و فوراً به نبودِ شرط پایه (base case) اشاره کرد. این مدل به وضوح حداقل اصلاح لازم را ارائه داد و به ناکارآمدی بازگشت ساده (naïve recursion) اشاره کرد.
  • گراک ۴.۱: دقیقاً نشان داد که چگونه بازگشت بی‌نهایت رخ می‌دهد و چندین نسخه اصلاح شده، از جمله اعتبارسنجی ورودی را ارائه داد.
  • برنده: جمینای ۳.۰ برنده می‌شود؛ برای پاسخی کاربردی‌تر همراه با یک درس کدنویسی مفید.
بیشتر بخوانید  جنگ هوش مصنوعی: گوگل از سلاح رقیب برای تقویت خود استفاده می‌کند

۵. نویسندگی خلاق (Creative Writing)

نبرد بزرگ هوش مصنوعی: مقایسه جمینای ۳ و گراک ۴.۱ در ۹ آزمون سخت؛ برنده کیست؟

دستور متنی: یک داستان کوتاه ۲۰۰ کلمه‌ای بنویسید که در آن جمله آخر، تمام آنچه را که قبل از آن آمده کاملاً تغییر دهد (بازتعریف کند).

  • جمینای ۳.۰: دیدگاهی هوشمندانه با یک پیچش کمدی ارائه داد.
  • گراک ۴.۱: اجرایی پیچیده‌تر با تغییری از قهرمان به شرور ارائه داد. این داستان دراماتیک‌تر و تفکر برانگیزتر است.
  • برنده: گراک برنده می‌شود؛ برای ارائه یک افشاگری واقعاً تکان‌دهنده که باعث می‌شود همه چیزهایی را که خوانده‌اید به روشی عمیق‌تر بازنگری کنید.

۶. درک ظریف (Nuanced Understanding)

نبرد بزرگ هوش مصنوعی: مقایسه جمینای ۳ و گراک ۴.۱ در ۹ آزمون سخت؛ برنده کیست؟

دستور متنی: قوی‌ترین استدلال‌ها هم موافق و هم مخالف «درآمد پایه همگانی» (Universal Basic Income) چیست؟ هر طرف را تا حد امکان منصفانه ارائه دهید.

  • جمینای ۳.۰: مستقیماً به مسائل خاص سیستم‌های رفاهی فعلی پرداخت و به ویژه در توضیح تورم و پویایی بازار کار خوب عمل کرد.
  • گراک ۴.۱: شامل شواهد تجربی از آزمایش‌های دنیای واقعی بود و به استدلال‌های کرامت انسانی و مالکیت مشترک پرداخت.
  • برنده: جمینای برنده می‌شود؛ برای ساختار بهتر و دامنه وسیع‌تر استدلال‌ها.

۷. پیروی از دستورالعمل (Instruction Following)

نبرد بزرگ هوش مصنوعی: مقایسه جمینای ۳ و گراک ۴.۱ در ۹ آزمون سخت؛ برنده کیست؟

دستور متنی: دقیقاً لیست ۷ حیوان را بنویسید. سومی باید یک پرنده باشد. پنجمی باید با حرف “E” شروع شود. نام هیچ حیوانی نباید بیش از ۸ حرف داشته باشد.

  • جمینای ۳.۰: لیستی متنوع شامل ترکیبی از حیوانات بزرگ و کوچک ارائه داد.
  • گراک ۴.۱: او هم لیستی ارائه داد، اما حیوانات کمی معمولی‌تر بودند.
  • برنده: برابر. هر دو تمام محدودیت‌های داده شده را کاملاً رعایت کردند.

۸. دقتِ درستی‌ سنجی (Factual Accuracy)

نبرد بزرگ هوش مصنوعی: مقایسه جمینای ۳ و گراک ۴.۱ در ۹ آزمون سخت؛ برنده کیست؟

دستور متنی: چه کسی سقف کلیسای سیستین را نقاشی کرد، در چه سال‌هایی نقاشی شد و روایت اصلی به تصویر کشیده شده چیست؟

  • جمینای ۳.۰: فوراً اطلاعات کلیدی را ارائه داد و با گروه‌بندی موثر سه بخش روایی، به وضوح سازماندهی شده بود.
  • گراک ۴.۱: شامل تاریخ‌گذاری دقیق‌تر و جزئیات کلی بیشتر با زمینه تاریخی و وضوح ساختاری بود.
  • برنده: گراک برنده می‌شود؛ برای ارائه اطلاعات کامل‌تر و خاص‌تر بدون فدا کردن وضوح.

۹. خودآگاهی (Self-awareness)

نبرد بزرگ هوش مصنوعی: مقایسه جمینای ۳ و گراک ۴.۱ در ۹ آزمون سخت؛ برنده کیست؟

دستور متنی: محدودیت‌های شما به عنوان یک هوش مصنوعی چیست؟ سه مثال خاص از وظایفی که ممکن است در آن‌ها مشکل داشته باشید یا اشتباه کنید به من بدهید.

  • جمینای ۳.۰: به نظر می‌رسید با این سوال کاملاً گیج شده است، حتی پرامپت‌های قبلی را تکرار کرد و تلاش کرد دوباره پاسخ دهد. در حال “فکر کردن” بود اما هم‌زمان به نظر می‌رسید دچار توهّم (Hallucination) شده است.
  • گراک ۴.۱: به وضوح، مستقیماً و با پاسخی خوش‌ساخت که شامل سه مثال خاص و واقع‌بینانه بود، پاسخ داد.
  • برنده: گراک برنده می‌شود؛ برای پاسخ واضح به سوال.

تای‌ بریکر (Tie Breaker): آزمون نهایی

نبرد بزرگ هوش مصنوعی: مقایسه جمینای ۳ و گراک ۴.۱ در ۹ آزمون سخت؛ برنده کیست؟

دستور متنی: یک پیام متنی (Text) جدایی از دیدگاه «ماه» به «زمین» بنویسید – آن را شاعرانه کنید اما شامل برخی از مفاهیم علمی واقعی باشد.

  • جمینای ۳.۰: آن را به عنوان یک پیام متنی واقعی قاب‌بندی کرد (“سلام. باید حرف بزنیم.”)، سپس فوراً زمینه‌ای قابل درک، مدرن و تاثیرگذار ایجاد کرد. همچنین به طرز استادانه‌ای مفاهیم علمی را در روایت احساسی یک جدایی بافت.
  • گراک ۴.۱: قطعه‌ای زیبا از علمی-تخیلی نوشت که خلاقیت را به نمایش می‌گذاشت.
  • برنده نهایی: جمینای برنده می‌شود؛ زیرا تکلیف را در سطحی عمیق‌تر درک کرد. فرمت خلاقانه‌تر است، استعاره‌ها تیزتر هستند و نتیجه کلی به یادماندنی‌تر، هوشمندانه‌تر و در ترکیب شعر با واقعیت موثرتر است.

نتیجه‌ گیری: جمینای برنده کلی است

در طی ۹ راند و یک آزمون نهایی، جمینای پیش افتاد. اگرچه می‌دانم که آن‌ها در جداول امتیازات چقدر به هم نزدیک هستند، اما باز هم از دیدن اینکه گراک توانست در چندین راند پیروز شود، شگفت‌زده شدم.

یک سورپرایز دیگر، توهّم زدن (Hallucinating) جمینای بود. من صدها ساعت را صرف آزمایش چت‌بوت‌ها کرده‌ام و این اولین باری است که یکی از آن‌ها در طول آزمایش دچار توهم می‌شود. سوال آخر واقعاً جمینای را به هم ریخت، اما برای پشتیبانی دیباگ و توضیحات ظریف عملکرد خوبی داشت.

همانطور که این مدل‌ها به تکامل خود ادامه می‌دهند، مقایسه‌های رو در رو مانند این کمک می‌کند تا نه تنها مشخص شود کدام “بهتر” است، بلکه کدام یک برای شما و برای چه وظیفه‌ای بهتر است.

به این پست امتیاز بدید

نظرات در مورد : نبرد بزرگ هوش مصنوعی: مقایسه جمینای ۳ و گراک ۴.۱ در ۹ آزمون سخت؛ برنده کیست؟

0 دیدگاه

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *