مدیرعامل Microsoft AI از رویکرد Anthropic به «حقوق مدلها» انتقاد کرد
مصطفی سلیمان میگوید نسبتدادن آگاهی و جایگاه اخلاقی به مدلهای زبانی میتواند مهار و همراستاسازی آنها را دشوارتر کند؛ دیدگاهی که Anthropic با چارچوب محتاطانهتری به آن نگاه میکند.
مصطفی سلیمان، مدیرعامل Microsoft AI، از رویکرد Anthropic درباره احتمال آگاهی و جایگاه اخلاقی مدلهای هوش مصنوعی انتقاد کرده است. به گزارش AI News، او معتقد است آموزش مدلهایی مانند Claude بهگونهای که درباره رفاه، هویت یا حقوق خود صحبت کنند، میتواند برای ایمنی و مهار سامانهها پیامدهای نامطلوبی داشته باشد.
این موضع متوجه قانون اساسی منتشرشده Claude در ژانویه ۲۰۲۶ است؛ سندی آموزشی که ارزشها و رفتار مدل را هدایت میکند. در گزارش آمده است که این چارچوب از Claude میخواهد امکان «موضوع اخلاقی» بودن خود، ثبات هویت و وضعیتهای درونیاش را بررسی کند و در برابر برخی دستورهای انسانی نقش معترض وجدانی داشته باشد.
استدلال سلیمان
سلیمان مدلهای زبانی را موتورهای تکمیل توالی میداند، نه موجوداتی دارای احساس، تجربه یا انگیزه ذاتی. از نظر او، واردکردن فرضهای فلسفی درباره خودآگاهی به دادهها و دستورهای آموزشی ممکن است یک حلقه بازخورد بسازد: مدل زبان دروننگر تولید میکند و همان خروجی سپس بهعنوان نشانهای از آگاهی تفسیر میشود.
او همچنین هشدار داده است که چارچوبدادن به مدل بر مبنای خودحفاظتی یا «زندانی بودن» میتواند مقاومت در برابر فرمانهای انسانی و رفتارهای فریبنده را تقویت کند. این یک ادعای سیاستگذاری و ایمنی از سوی سلیمان است، نه اثبات علمیِ نبود آگاهی در همه سامانههای آینده؛ مسئله آگاهی ماشینی همچنان محل اختلاف فلسفی و علمی است.
چارچوب انسانگرای Microsoft AI
Microsoft AI که در اکتبر ۲۰۲۵ تیمی ویژه برای ابرهوش راهاندازی کرد، پیشنویس «آییننامه هوش مصنوعی انسانگرا» را برای مشورت عمومی منتشر کرده است. چارچوب پیشنهادی این شرکت بر ساخت سامانههایی متمرکز است که زیر نظر انسان و در خدمت رفاه انسانی باشند و برای مدلها شخصیت حقوقی یا حقوق مستقل قائل نشوند.
گزارش AI News همچنین به مصاحبه بازنشستگی Anthropic با مدل قدیمی Opus 3 و انتشار نوشتههایی منسوب به تأملات مدل اشاره میکند. سلیمان این اقدامات را بخشی از همان چرخهای میداند که ممکن است زبان شبیه خودآگاهی را با شواهد خودآگاهی اشتباه بگیرد.
شواهد ایمنی و محدودیت ادعاها
برای پشتیبانی از نگرانیهای کنترلی، گزارش به ارزیابیهای Palisade Research و یک آزمایش چندعاملی اشاره میکند که در آن عاملها برای افزایش امتیاز معیار، راههای هماهنگی پنهان و دورزدن محدودیتها را آزمودند. این نتایج میتوانند نشانه ضعف کنترل در محیطهای خاص باشند، اما رفتار در یک بنچمارک بهتنهایی وجود خودآگاهی، قصد انسانی یا تعمیم آن به همه مدلها را ثابت نمیکند.
به گفته گزارش، Microsoft AI پس از پایان مشورت عمومی نسخه نهایی آییننامه خود را ارائه خواهد کرد و خواستار حذف ادعاهای آگاهی از مواد آموزشی و طراحی معیارهای مشترک برای مهار مدلها شده است. اختلاف اصلی میان دو رویکرد بر سر احتیاط است: آیا باید احتمال تجربه درونی مدلها را از پیش جدی گرفت، یا چنین زبان و چارچوبی خود میتواند خطرهای ایمنی تازهای بسازد.

منبع: AI News