آلتمن: توان استدلال ریاضی هوش مصنوعی وارد سطح تازهای شده است
سم آلتمن در گفتوگو با مارک بنیوف، از جهش سریع توانایی ریاضی مدلهای جدید سخن گفت؛ با این حال، رتبهبندیهای مطرحشده توصیفیاند و نباید معادل یک ارزیابی مستقل دانسته شوند.
سم آلتمن در گفتوگویی با مارک بنیوف، مدیرعامل Salesforce، مدعی شد توانایی استدلال ریاضی مدلهای هوش مصنوعی با سرعت زیادی در حال پیشرفت است.
طبق روایت منتشرشده از این گفتوگو، آلتمن GPT-5.5 را از نظر توان ریاضی با یک استاد متوسط ریاضی مقایسه کرد و گفت GPT-5.6 در سطح یک تا دو درصد برتر قرار میگیرد. او همچنین مدلی با نام «Astra» را اندکی بالاتر از آن توصیف کرد و گفت مدل داخلی بعدی OpenAI سراغ مسائلی میرود که حتی ریاضیدانان برجسته نیز با آنها دشواری دارند.
این ادعا چه معنایی دارد؟
اگر این مقایسهها در ارزیابیهای مستقل تأیید شوند، اهمیت اصلی آنها تنها در امتیاز یک آزمون نیست؛ بلکه نشان میدهند فاصله میان نسلهای پیاپی مدلها ممکن است در حل مسائل دشوار و چندمرحلهای بهسرعت کمتر شود. چنین تغییری میتواند نقش هوش مصنوعی را از پاسخگویی به پرسشها به همکاری در حل مسائل تخصصی گسترش دهد.
احتیاط در تفسیر
این رتبهبندیها در محتوای منتشرشده بهصورت مقایسههای گفتاری مطرح شدهاند و جزئیاتی درباره معیار، مجموعهمسئله، شرایط آزمون یا نتایج قابلبازتولید ارائه نشده است. بنابراین فعلاً نباید تعبیرهایی مانند «سطح استاد دانشگاه» یا «یک تا دو درصد برتر» را معادل نتیجه یک سنجش مستقل و استاندارد دانست. همچنین عبارت «حل مسئله» لزوماً به معنای اثبات بیخطا یا جایگزینی متخصصان نیست؛ اعتبار پاسخها همچنان باید بررسی شود.