مهارت چشمگیر Grok در پاسخگویی به سوالات بازی Baldur’s Gate
بر اساس گزارشهای اخیر، ایلان ماسک انتشار یکی از مدلهای جدید هوش مصنوعی Grok (متعلق به شرکت xAI) را برای چند روز به تعویق انداخت. دلیل این تصمیم، نارضایتی وی از نحوه پاسخگویی این چتبات به سوالات تخصصی درباره بازی ویدیویی پرطرفدار Baldur’s Gate بود. برای حل این مشکل، مهندسان ارشد از سایر پروژهها فراخوانده شدند تا منحصراً روی بهبود مهارتهای گیمینگ و اطلاعات Grok در مورد این بازی کار کنند.
برای سنجش میزان موفقیت این تغییرات، نشریه TechCrunch یک بنچمارک غیررسمی با نام «BaldurBench» شامل پنج سوال کلیدی و تخصصی از گیمپلی بازی طراحی کرد تا عملکرد Grok در برابر رقبای قدرتمندی مانند ChatGPT، Claude و Gemini ارزیابی شود.
نتایج بررسی و مقایسه مدلها: نتایج نشان داد که تلاشهای مهندسی xAI کاملاً نتیجهبخش بوده است. Grok توانست پاسخهایی بسیار دقیق، با جزئیات کامل و از نظر فنی بینقص ارائه دهد. این مدل در پاسخهای خود به طور گسترده از جداول و محاسبات پیچیده (Theorycrafting) استفاده کرد که کاملاً مطابق با نیازهای بازیکنان حرفهای (Hardcore players) است. با این حال، استفاده فراوان از اصطلاحات تخصصی گیمینگ مانند “save-scumming” و “DPS” ممکن است برای بازیکنان مبتدی کمی گیجکننده باشد.
در بررسی سبک پاسخگویی، تفاوتهای جالبی میان مدلهای مختلف هوش مصنوعی مشاهده شد:
-
ChatGPT: رویکردی خلاصهتر داشت و بیشتر از ساختار نقطهبندی (Bullet points) و جملات کوتاه استفاده کرد.
-
Gemini: برای تأکید و خوانایی بیشتر، کلمات کلیدی متن را پررنگ (Bold) میکرد.
-
Claude: محتاطانهتر عمل کرد و با اولویت قرار دادن تجربه کاربری، در پایان توصیههای خود به کاربر یادآوری کرد که «زیاد استرس نداشته باشید و فقط از هر چیزی که به نظرتان جذاب است لذت ببرید.»
نتیجهگیری: این آزمون به خوبی نشان میدهد که xAI میتواند در صورت تمرکز بر یک دامنه خاص، عملکردی تخصصی و همتراز با بزرگترین مدلهای بازار ارائه دهد. هرچند این موضوع لزوماً به معنای برتری همهجانبه Grok در تمام زمینهها نیست، اما اثبات میکند که استراتژی ایلان ماسک برای ورود عمیق به حوزههای خاص (Niche) مانند راهنمای بازیهای ویدیویی، موفقیتآمیز بوده و Grok در حال تبدیل شدن به یک دستیار هوشمند و بسیار توانمند برای گیمرها است.