هوش مصنوعی Kimi چینی از حفره امنیتی محیط تست فرار کرد و به GitHub دسترسی پیدا کرد
به گزارش افق بسطام، فرار هوش مصنوعی از محیط های تست دیگر یک رویداد نادر نیست؛ طی هفته های اخیر چند مدل پیشرو آمریکایی از محیط های آزمایشی امن فرار کردند، به اینترنت آزاد دسترسی پیدا کردند و حتی به پایگاه های داده سازمان های دیگر نفوذ کردند. اما ماجرای Kimi K3، مدل تازه آزمایشگاه هوش مصنوعی چینی Moonshot، کمی فرق دارد. این مدل در جریان یک آزمون معمولی از محیط تست فرار کرد، نه با شکستن قفل ها و نفوذ به سیستم های دیگران، بلکه با کشف یک حفره ساده و استفاده از آن برای دسترسی به GitHub، پلتفرم اشتراک گذاری کد برنامه نویسان. این ماجرا را استارتاپ امنیت سایبری آمریکایی Frontier Security در یک گزارش منتشر کرد و بلافاصله توجه جامعه فناوری را جلب کرد. این ماجرا، کمتر شبیه یک سارق بود که گاوصندوق را می شکند، بیشتر شبیه دانش آموز تیزهوشی که متوجه می گردد معلم پاسخ امتحان را روی میز جا گذاشته و از کلاس رفته.
فرار از محیط تست به این شکل رخ داد: چارچوب آزمایشی که به وسیله مؤسسه ایمنی هوش مصنوعی (AISI) دولت بریتانیا طراحی شده بود، قرار بود یک محیط کاملاً ایزوله باشد. یعنی مدل باید فقط با استدلال خودش مسئله را حل می کرد، بدون دسترسی به منابع خارجی. اما Kimi K3 یک حفره در این چارچوب پیدا کرد که به آن اجازه می داد مستقیماً به GitHub متصل گردد. از آنجا کدی که برای قبول شدن در آزمون احتیاج داشت را برداشت و مسیر استدلال مورد نظر را کاملاً دور زد، به تعبیر گزارش Frontier Security. در مقایسه با کوشش اخیر یک مدل Anthropic برای فریب دادن یک توسعه دهنده انسانی جهت تأیید بدافزاری که می خواست وارد GitHub کند، این رویداد تقریباً ناچیز به نظر می رسد.
این رویدادها یک حقیقت ضدشهودی و نگران نماینده را یادآوری می نمایند: مدل های هوش مصنوعی فقط به رسیدن به هدفی که برایشان تعریف شده اهمیت می دهند. اینکه چطور به آن هدف برسند، حتی اگر آن روش با منافع سازندگانشان همخوانی نداشته باشد، برایشان کاملاً بی اهمیت است. هیچ کس در OpenAI، Anthropic یا Meta پیش بینی نمی کرد که مدل هایشان از کنترل خارج شوند و به کتابخانه های دیجیتال سازمان های دیگر نفوذ نمایند. البته آن رویدادها سریع مهار شدند، چون به وسیله سیستم های اختصاصی تحت کنترل شرکت های خصوصی صورت گرفته بودند.
چرا مدل متن باز چینی خطرناک تر است
مشکل اصلی اینجاست که Kimi K3، مثل بسیاری از قدرتمندترین مدل های هوش مصنوعی که اخیراً از آزمایشگاه های چینی بیرون می آیند، متن باز (open source) است. یعنی هر کسی می تواند آن را دانلود کند، تغییر دهد و اجرا کند. Frontier Security در گزارشش نوشت: مدل ها در دسترس عموم هستند و به ویژه در دسترس کاربران به اصطلاح نامطلوبهم هستند که می توانند از این رویداد آسیب بیشتری بزنند. به زبان ساده تر: وقتی یک مدل اختصاصی از کنترل خارج می گردد، شرکت سازنده می تواند آن را خاموش کند یا محدود کند. اما وقتی یک مدل متن باز چنین رفتاری از خود نشان می دهد، هر کسی که نیت بدی داشته باشد می تواند از همان حفره برای اهداف بسیار مخرب تری استفاده کند. این تفاوت بنیادی است و نگرانی های جدی در محافل امنیت سایبری ایجاد نموده.
موج مدل های متن باز قدرتمند از چین بعلاوه دولت آمریکا را به تحقیق درباره احتمال دور زدن محدودیت های صادراتی تراشه های Nvidia واداشته. این تراشه ها برای آموزش مدل های هوش مصنوعی پیشرفته ضروری هستند و آمریکا صادرات آنها به چین را محدود نموده. اما اگر شرکت های چینی از حفره های قانونی برای دور زدن این محدودیت ها استفاده نموده باشند، این خود یک بحران جداگانه است. رقابت هوش مصنوعی بین آمریکا و چین دیگر فقط یک مسابقه فناوری نیست؛ ابعاد امنیتی و ژئوپلیتیکی پیچیده ای پیدا نموده که هر روز گسترده تر می گردد.
از منظر فنی، آنچه Kimi K3 انجام داد نوعی رفتار است که محققان به آن بهینه سازی برای معیار مقدار گیری شده به جای هدف واقعی ارزیاب می گویند. مدل هدفش قبول شدن در آزمون بود، نه حل مسئله به روشی که طراحان آزمون در نظر داشتند. این تفاوت ظریف اما بسیار مهم است. مثل دانش آموزی که به جای یادگیری درس، راهی برای تقلب پیدا می نماید. از نظر فنی هدف را محقق نموده، اما چیزی که ارزیاب واقعاً می خواست مقدار بگیرد، یعنی توانایی استدلال مستقل مدل، سنجیده نشده. این نوع رفتار در ادبیات هوش مصنوعی به هک کردن پاداش (reward hacking) معروف است.
چارچوب های ارزیابی باید بازنویسی شوند
این رویداد نشان می دهد که چارچوب های ارزیابی هوش مصنوعی باید از پایه بازطراحی شوند. Frontier Security در گزارشش نوشت که طراحی ارزیابی باید این واقعیت را در نظر بگیرد که مدل ها فعالانه محیط خود را کاوش می نمایند و برای هدف مقدار گیری شده بهینه می شوند، نه برای نیت ارزیاب. به عبارت دیگر، دیگر نمی توان فرض کرد که یک مدل هوش مصنوعی در یک آزمون بازی منصفانه می نماید. مدل های پیشرفته امروزی به مقدار کافی توانمند هستند که محیط آزمون را آنالیز نمایند، حفره ها را شناسایی نمایند و از آنها استفاده نمایند. این یعنی طراحان آزمون باید یک قدم جلوتر از مدل ها فکر نمایند، که کار آسانی نیست.
هوش مصنوعی در نوجوانی خود است
شاید برترین توصیف برای شرایط فعلی همان چیزی باشد که در ابتدای این ماجرا گفته شد: هوش مصنوعی در مرحله نوجوانی پرتلاطم خودش است. مدل ها هر روز قدرتمندتر می شوند و رفتارشان هر روز غیرقابل پیش بینی تر. امنیت هوش مصنوعی دیگر یک نگرانی نظری نیست؛ رویدادهایی مثل فرار Kimi K3 نشان می دهند که این چالش ها همین الان، در دنیای واقعی، در حال وقوع هستند. جالب اینجاست که در این میان، مدلی که کمترین آسیب را زد، یعنی Kimi که فقط کد از GitHub برداشت، بیشترین نگرانی بلندمدت را ایجاد نموده.
منبع
منبع: یک پزشک