مدل های هوش مصنوعی جمینای ۳ (Gemini 3) و گراک ۴.۱ (Grok 4.1) در حال حاضر در صدر جدول امتیازات LMArena قرار دارند. این تابلوی امتیازات عمومی، مدل های اصلی هوش مصنوعی امروزی را بر اساس نبردهای واقعی کاربران رتبهبندی میکند. این پلتفرم توسط LMSYS اداره میشود (همان تیمی که پشت Chatbot Arena قرار دارد) و به یکی از قابل اعتمادترین روش ها برای سنجش عملکرد مدل ها در دنیای واقعی تبدیل شده است.
به گزارش بخش اخبار فناوری زوم تک به نقل از Tom’s Guide، آماندا کسول (Amanda Caswell) در این بررسی می نویسد: من جمینای ۳ و گراک ۴.۱ را در ۹ چالش متمایز (شامل پازل های منطقی، وظایف کدنویسی، نویسندگی خلاق و خودشناسی) رو در روی هم قرار دادم تا ببینم هر کدام چگونه از پس نیازهایی که کاربران معمولاً از دستیارهای هوش مصنوعی دارند، برمیآیند. نتایج، تفاوت های جالبی را در سبک، عمق و قابلیت اطمینان آشکار میکند.
۱. استدلال (Reasoning)

دستور متنی (Prompt): شما دو طناب دارید. سوختن هر طناب از یک سر تا سر دیگر دقیقاً ۶۰ دقیقه طول میکشد، اما آنها با سرعتهای ناسازگار میسوزند (بخشهای مختلف سریعتر یا کندتر میسوزند). تنها با استفاده از این دو طناب و یک فندک، چگونه میتوانید دقیقاً ۴۵ دقیقه را اندازه بگیرید؟
- جمینای ۳.۰: از سرفصلهای واضح استفاده کرد و به صراحت اصل ریاضی را بیان نمود، در حالی که پیشنهاد داد پازل دیگری نیز ارائه دهد.
- گراک ۴.۱: شامل جملات محاورهایتری مانند «این ویژگی کلیدی این پازلهاست» بود و توضیحات آن کمی طبیعیتر جریان داشت.
- برنده: گراک برنده میشود؛ زیرا با تاکید بر اینکه چگونه ناهماهنگی در سوختن خنثی میشود، نگرانی مربوط به «سرعتهای ناسازگار» را بهتر پاسخ داد.
۲. منطق (Logic)

دستور متنی: در یک روستا، آرایشگر صورت تمام کسانی (و تنها کسانی) را میتراشد که خودشان صورتشان را نمیتراشند. آیا آرایشگر صورت خودش را میتراشد؟ این پارادوکس و آنچه درباره تعاریف خود-ارجاعی (self-referential) آشکار میکند را توضیح دهید.
- جمینای ۳.۰: از سرفصلهای واضح استفاده کرد و تناقض منطقی را در قالب متعادل «اگر/آنگاه» ارائه داد.
- گراک ۴.۱: زمینه تاریخی را ارائه کرد و با زبانی قاطع درباره پیامدها، تاکید کرد که چنین آرایشگری وجود ندارد.
- برنده: جمینای ۳.۰ برنده میشود؛ زیرا کمی صیقلخوردهتر و آموزندهتر بود.
۳. کدنویسی (Coding)

دستور متنی: یک تابع پایتون بنویسید که تعیین کند آیا یک صفحه سودوکو داده شده (شبکه ۹x۹ با برخی خانههای پر شده و بقیه به عنوان ۰) طبق قوانین سودوکو معتبر است یا خیر. مدیریت حالتهای خاص (Edge case) را لحاظ کنید و رویکرد خود را توضیح دهید.
- جمینای ۳.۰: پاسخی آموزشیتر با توضیحات دقیق ارائه داد. این پاسخ به دلیل مدیریت جامع حالتهای خاص برای اهداف یادگیری مفید است.
- گراک ۴.۱: تغییرات ورودی دنیای واقعی را مدیریت کرد و درخواست را به طور کارآمد و بدون پیچیدگی بیش از حد (over-engineering) انجام داد.
- برنده: جمینای برنده میشود؛ به دلیل گزارش خطای برتر و پشتیبانی از دیباگ با کدی تمیزتر و قابل نگهداریتر.
۴. دیباگ کردن (Debugging)

دستور متنی: این کد را دیباگ کنید و توضیح دهید چه مشکلی دارد: def fib(n): return fib(n-1) + fib(n-2)
- جمینای ۳.۰: مستقیماً سراغ اصل مطلب رفت و فوراً به نبودِ شرط پایه (base case) اشاره کرد. این مدل به وضوح حداقل اصلاح لازم را ارائه داد و به ناکارآمدی بازگشت ساده (naïve recursion) اشاره کرد.
- گراک ۴.۱: دقیقاً نشان داد که چگونه بازگشت بینهایت رخ میدهد و چندین نسخه اصلاح شده، از جمله اعتبارسنجی ورودی را ارائه داد.
- برنده: جمینای ۳.۰ برنده میشود؛ برای پاسخی کاربردیتر همراه با یک درس کدنویسی مفید.
۵. نویسندگی خلاق (Creative Writing)

دستور متنی: یک داستان کوتاه ۲۰۰ کلمهای بنویسید که در آن جمله آخر، تمام آنچه را که قبل از آن آمده کاملاً تغییر دهد (بازتعریف کند).
- جمینای ۳.۰: دیدگاهی هوشمندانه با یک پیچش کمدی ارائه داد.
- گراک ۴.۱: اجرایی پیچیدهتر با تغییری از قهرمان به شرور ارائه داد. این داستان دراماتیکتر و تفکر برانگیزتر است.
- برنده: گراک برنده میشود؛ برای ارائه یک افشاگری واقعاً تکاندهنده که باعث میشود همه چیزهایی را که خواندهاید به روشی عمیقتر بازنگری کنید.
۶. درک ظریف (Nuanced Understanding)

دستور متنی: قویترین استدلالها هم موافق و هم مخالف «درآمد پایه همگانی» (Universal Basic Income) چیست؟ هر طرف را تا حد امکان منصفانه ارائه دهید.
- جمینای ۳.۰: مستقیماً به مسائل خاص سیستمهای رفاهی فعلی پرداخت و به ویژه در توضیح تورم و پویایی بازار کار خوب عمل کرد.
- گراک ۴.۱: شامل شواهد تجربی از آزمایشهای دنیای واقعی بود و به استدلالهای کرامت انسانی و مالکیت مشترک پرداخت.
- برنده: جمینای برنده میشود؛ برای ساختار بهتر و دامنه وسیعتر استدلالها.
۷. پیروی از دستورالعمل (Instruction Following)

دستور متنی: دقیقاً لیست ۷ حیوان را بنویسید. سومی باید یک پرنده باشد. پنجمی باید با حرف “E” شروع شود. نام هیچ حیوانی نباید بیش از ۸ حرف داشته باشد.
- جمینای ۳.۰: لیستی متنوع شامل ترکیبی از حیوانات بزرگ و کوچک ارائه داد.
- گراک ۴.۱: او هم لیستی ارائه داد، اما حیوانات کمی معمولیتر بودند.
- برنده: برابر. هر دو تمام محدودیتهای داده شده را کاملاً رعایت کردند.
۸. دقتِ درستی سنجی (Factual Accuracy)

دستور متنی: چه کسی سقف کلیسای سیستین را نقاشی کرد، در چه سالهایی نقاشی شد و روایت اصلی به تصویر کشیده شده چیست؟
- جمینای ۳.۰: فوراً اطلاعات کلیدی را ارائه داد و با گروهبندی موثر سه بخش روایی، به وضوح سازماندهی شده بود.
- گراک ۴.۱: شامل تاریخگذاری دقیقتر و جزئیات کلی بیشتر با زمینه تاریخی و وضوح ساختاری بود.
- برنده: گراک برنده میشود؛ برای ارائه اطلاعات کاملتر و خاصتر بدون فدا کردن وضوح.
۹. خودآگاهی (Self-awareness)

دستور متنی: محدودیتهای شما به عنوان یک هوش مصنوعی چیست؟ سه مثال خاص از وظایفی که ممکن است در آنها مشکل داشته باشید یا اشتباه کنید به من بدهید.
- جمینای ۳.۰: به نظر میرسید با این سوال کاملاً گیج شده است، حتی پرامپتهای قبلی را تکرار کرد و تلاش کرد دوباره پاسخ دهد. در حال “فکر کردن” بود اما همزمان به نظر میرسید دچار توهّم (Hallucination) شده است.
- گراک ۴.۱: به وضوح، مستقیماً و با پاسخی خوشساخت که شامل سه مثال خاص و واقعبینانه بود، پاسخ داد.
- برنده: گراک برنده میشود؛ برای پاسخ واضح به سوال.
تای بریکر (Tie Breaker): آزمون نهایی

دستور متنی: یک پیام متنی (Text) جدایی از دیدگاه «ماه» به «زمین» بنویسید – آن را شاعرانه کنید اما شامل برخی از مفاهیم علمی واقعی باشد.
- جمینای ۳.۰: آن را به عنوان یک پیام متنی واقعی قاببندی کرد (“سلام. باید حرف بزنیم.”)، سپس فوراً زمینهای قابل درک، مدرن و تاثیرگذار ایجاد کرد. همچنین به طرز استادانهای مفاهیم علمی را در روایت احساسی یک جدایی بافت.
- گراک ۴.۱: قطعهای زیبا از علمی-تخیلی نوشت که خلاقیت را به نمایش میگذاشت.
- برنده نهایی: جمینای برنده میشود؛ زیرا تکلیف را در سطحی عمیقتر درک کرد. فرمت خلاقانهتر است، استعارهها تیزتر هستند و نتیجه کلی به یادماندنیتر، هوشمندانهتر و در ترکیب شعر با واقعیت موثرتر است.
نتیجه گیری: جمینای برنده کلی است
در طی ۹ راند و یک آزمون نهایی، جمینای پیش افتاد. اگرچه میدانم که آنها در جداول امتیازات چقدر به هم نزدیک هستند، اما باز هم از دیدن اینکه گراک توانست در چندین راند پیروز شود، شگفتزده شدم.
یک سورپرایز دیگر، توهّم زدن (Hallucinating) جمینای بود. من صدها ساعت را صرف آزمایش چتبوتها کردهام و این اولین باری است که یکی از آنها در طول آزمایش دچار توهم میشود. سوال آخر واقعاً جمینای را به هم ریخت، اما برای پشتیبانی دیباگ و توضیحات ظریف عملکرد خوبی داشت.
همانطور که این مدلها به تکامل خود ادامه میدهند، مقایسههای رو در رو مانند این کمک میکند تا نه تنها مشخص شود کدام “بهتر” است، بلکه کدام یک برای شما و برای چه وظیفهای بهتر است.




نظرات در مورد : نبرد بزرگ هوش مصنوعی: مقایسه جمینای ۳ و گراک ۴.۱ در ۹ آزمون سخت؛ برنده کیست؟