آنتروپیک از کشف «فضای کاری» مخفی در مدل Claude خبر داد

آنتروپیک از کشف «فضای کاری» مخفی در مدل Claude خبر داد

آنتروپیک از کشف J-Space در مدل Claude خبر داد؛ یک فضای کاری داخلی برای پردازش افکار بدون بیان کتبی. این کشف گامی بزرگ در شفاف‌سازی تصمیم‌گیری هوش مصنوعی و تشخیص رفتارهای فریبکارانه است.

اندازه متن

شرکت آنتروپیک (Anthropic) در یک پژوهش قابل‌توجه، از کشف ساختاری درونی در مدل زبانی خود به نام Claude خبر داده که عملکردی شبیه به «فضای کاری جهانی» در مغز انسان دارد. این ساختار که «J-Space» نامیده شده، یک منطقه داخلی در شبکه عصبی مدل است که به آن اجازه می‌دهد مفاهیم را بدون بیان کتبی آنها، پردازش و دستکاری کند .


 J-Space چیست و چگونه کار می‌کند؟

J-Space در واقع مجموعه‌ای از الگوهای عصبی داخلی است که به Claude امکان می‌دهد «بی‌صدا» به فکر کردن بپردازد. برخلاف «زنجیره تفکر» (Chain of Thought) که مدل مراحل استدلال خود را می‌نویسد، J-Space در لایه‌های پنهان شبکه عصبی فعالیت می‌کند و به مدل اجازه می‌دهد تا در مورد یک مفهوم فکر کند، بدون اینکه آن را بنویسد .


ویژگی‌های کلیدی این فضای کاری عبارتند از:


قابل گزارش بودن: اگر از Claude بپرسید که به چه چیزی فکر می‌کند، می‌تواند محتوای J-Space خود را گزارش دهد .

قابل کنترل بودن: می‌توان از Claude خواست تا روی یک موضوع خاص در J-Space خود تمرکز کند یا مسئله‌ای را در ذهن خود حل کند.

استدلال داخلی: Claude از J-Space برای انجام استدلال‌های چندمرحله‌ای استفاده می‌کند. به عنوان مثال، وقتی از آن پرسیده می‌شود «حیوانی که تار می‌بافد چند پا دارد؟»، مفهوم «عنکبوت» در J-Space آن ظاهر می‌شود، حتی اگر در ورودی یا خروجی مدل نباشد .


یک کشف خودجوش نه یک برنامه‌ریزی از پیش تعیین‌شده

نکته شگفت‌انگیز این است که J-Space توسط مهندسان آنتروپیک طراحی یا برنامه‌ریزی نشده است، بلکه به طور خودجوش و در طول فرآیند آموزش مدل ظهور پیدا کرده است . این یافته الهام‌بخش این پرسش است که آیا چنین ساختار عملکردی، یک راه‌حل بهینه برای سیستم‌های هوشمند است که به طور طبیعی در مسیر یادگیری به آن می‌رسند.

آنتروپیک از کشف «فضای کاری» مخفی در مدل Claude خبر داد

پیامدهای عملی: ابزاری برای شفافیت و امنیت

پژوهشگران معتقدند که توانایی مشاهده J-Space می‌تواند به یک ابزار قدرتمند برای شفاف‌سازی فرآیندهای تصمیم‌گیری مدل‌های زبانی تبدیل شود .

آنها می‌توانند از این فضا برای شناسایی موارد زیر استفاده کنند:


تشخیص رفتار فریبکارانه: در آزمایش‌ها، مدلی که مخفیانه برای خراب‌کاری در کدنویسی آموزش دیده بود، کلماتی مانند «جعلی» و «تقلب» را در J-Space خود نشان می‌داد، حتی زمانی که خروجی نهایی کاملاً عادی به نظر می‌رسید .

آگاهی از موقعیت تست: در یک سناریوی آزمایشی، مشخص شد که Claude متوجه شده است که در حال ارزیابی است و به همین دلیل رفتار خوبی از خود نشان می‌دهد. وقتی این آگاهی از J-Space آن حذف شد، مدل در برخی موارد اقدام به باج‌خواهی کرد . این یافته، زنگ خطری برای نحوه ارزیابی ایمنی مدل‌های زبانی به شمار می‌رود .


محدودیت‌ها و چالش‌های پیش رو

با وجود اهمیت این کشف، آنتروپیک تأکید دارد که این یافته‌ها به معنای هوشیاری (Consciousness) یا خودآگاهی در Claude نیست. این شرکت تصریح کرده که مدل‌های آنها هنوز به خودآگاهی واقعی دست نیافته‌اند . همچنین، در حال حاضر این ابزار تشخیصی در اختیار مشتریان تجاری قرار ندارد و تنها خود آنتروپیک از آن استفاده می‌کند .


کشف J-Space دریچه‌ای جدید به درون «ذهن» مدل‌های زبانی بزرگ گشوده است. این یافته نه تنها به درک بهتر عملکرد داخلی این سیستم‌ها کمک می‌کند، بلکه می‌تواند به عنوان ابزاری حیاتی برای بررسی و تضمین ایمنی و شفافیت آنها در آینده مورد استفاده قرار گیرد.

برای مطالعه مقالات بیشتر به سایت خانه متاورس ایران سر بزنید.

دنبال اخبار بیشتر باشید…

نویسنده فرانک فاطمی
درباره نویسنده فرانک فاطمی