به گفته دانشمندان، هیچ روش جهانی وجود ندارد که بتوان داده ها را از یک مدل زبان بزرگ از پیش آموزش دیده حذف کرد.
سه نفر از دانشمندان از دانشگاه کارولینای شمالی، چپل هیل اخیرا منتشر شده تحقیقات هوش مصنوعی پیش از چاپ (AI) نشان میدهد که حذف دادههای حساس از مدلهای زبان بزرگ (LLM) مانند ChatGPT OpenAI و Bard Google چقدر دشوار است.
بر اساس مقاله محققان، وظیفه “حذف” اطلاعات از LLM ها امکان پذیر است، اما تأیید حذف اطلاعات به همان اندازه که حذف واقعی آن دشوار است، دشوار است.
دلیل این امر به نحوه مهندسی و آموزش LLM ها مربوط می شود. مدلها از قبل آموزش داده شدهاند (GPT مخفف ترانسفورماتور پیشآزمایششده مولد است) در پایگاههای داده و سپس برای تولید خروجیهای منسجم به دقت تنظیم میشوند.
هنگامی که یک مدل آموزش داده می شود، سازندگان آن نمی توانند، برای مثال، به پایگاه داده برگردند و فایل های خاصی را حذف کنند تا مدل را از خروجی نتایج مرتبط منع کنند. اساساً، تمام اطلاعاتی که یک مدل بر روی آنها آموزش می بیند، جایی در وزن ها و پارامترهای آن وجود دارد، جایی که بدون تولید خروجی قابل تعریف نیستند. این جعبه سیاه هوش مصنوعی است.
وقتی LLM هایی که بر روی مجموعه داده های عظیم آموزش دیده اند، اطلاعات حساسی مانند اطلاعات شناسایی شخصی، سوابق مالی یا سایر خروجی های بالقوه مضر/ناخواسته را خروجی می دهند، مشکل ایجاد می شود.
مربوط: مایکروسافت تیم انرژی هسته ای برای پشتیبانی از هوش مصنوعی تشکیل می دهد: گزارش
به عنوان مثال، در یک موقعیت فرضی که یک LLM در مورد اطلاعات حساس بانکی آموزش دیده است، معمولاً هیچ راهی برای خالق هوش مصنوعی وجود ندارد که آن فایل ها را پیدا کند و آنها را حذف کند. در عوض، توسعهدهندگان هوش مصنوعی از نردههای محافظ مانند پیامهای رمزگذاری شده استفاده میکنند که رفتارهای خاص یا تقویت یادگیری از بازخورد انسانی (RLHF) را مهار میکنند.
در پارادایم RLHF، ارزیابان انسانی مدل هایی را با هدف برانگیختن رفتارهای خواسته و ناخواسته درگیر می کنند. زمانی که خروجی های مدل ها مطلوب باشد، بازخوردی دریافت می کنند که مدل را با آن رفتار هماهنگ می کند. و هنگامی که خروجی ها رفتار ناخواسته ای را نشان می دهند، بازخورد طراحی شده برای محدود کردن چنین رفتاری در خروجی های آینده دریافت می کنند.

با این حال، همانطور که محققان UNC اشاره میکنند، این روش به انسانها متکی است که تمام نقصهایی را که یک مدل ممکن است نشان دهد، بیابند و حتی در صورت موفقیتآمیز بودن، باز هم اطلاعات را از مدل «حذف نمیکند».
طبق مقاله تحقیقاتی تیم:
یک نقص احتمالاً عمیقتر RLHF این است که یک مدل ممکن است هنوز اطلاعات حساس را بداند. در حالی که بحثهای زیادی در مورد اینکه مدلها واقعاً چه میدانند وجود دارد، به نظر میرسد که یک مدل بتواند نحوه ساخت یک سلاح زیستی را توصیف کند اما صرفاً از پاسخ دادن به سؤالات در مورد چگونگی انجام این کار خودداری کند.
در نهایت، محققان UNC به این نتیجه رسیدند که حتی یک مدل پیشرفته ویرایش روشهایی مانند ویرایش مدل رتبه یک (ROME) “در حذف کامل اطلاعات واقعی از LLMها ناکام میمانند، زیرا هنوز هم میتوان حقایق را در 38٪ مواقع توسط حملات جعبه سفید و 29٪ موارد توسط حملات جعبه سیاه استخراج کرد.”
مدلی که تیم برای انجام تحقیقات خود استفاده کردند GPT-J نام دارد. در حالی که GPT-3.5، یکی از مدل های پایه که ChatGPT را تامین می کند، با 170 میلیارد پارامتر تنظیم شده است، GPT-J تنها 6 میلیارد پارامتر دارد.
ظاهراً، این بدان معناست که مشکل یافتن و حذف دادههای ناخواسته در یک LLM مانند GPT-3.5 به طور تصاعدی دشوارتر از انجام این کار در یک مدل کوچکتر است.
محققان توانستند روشهای دفاعی جدیدی را برای محافظت از LLM در برابر برخی «حملههای استخراج» توسعه دهند – تلاشهای هدفمند بازیگران بد برای استفاده از تحریک برای دور زدن نردههای محافظ مدل به منظور خروجی اطلاعات حساس.
با این حال، همانطور که محققان می نویسند، “مشکل حذف اطلاعات حساس ممکن است مشکلی باشد که در آن روش های دفاعی همیشه به دنبال روش های حمله جدید هستند.”
این مطلب صرفاً از منبع ، ترجمه شده و مسئولیت آن با تریگر ویو نمی باشد.
اکانت پرمیوم تریدینگ ویو ارزان
لینک منبع خبر
[vc_row][vc_column][deeper_spacer][/vc_column][/vc_row][vc_row content_placement=”middle” canvas=”%5B%7B%22shape%22%3A%22shape-1%22%2C%22image_effect%22%3A%22style-1%22%2C%22smoothness%22%3A%2230%22%7D%5D” css=”.vc_custom_1686924614506{background-color: #eeeeee !important;border-radius: 20px !important;}”][vc_column width=”1/2″][deeper_spacer desktop=”32″ mobile=”6″ smobile=”6″][special_text_text text_style=”style-2″ text_color=”#000000″] همین الان اکانت تریدینگ ویوت رو بخر [/special_text_text][deeper_spacer desktop=”32″ mobile=”6″ smobile=”6″][/vc_column][vc_column width=”1/2″][deeper_spacer desktop=”32″ mobile=”6″ smobile=”6″][deeper_button button_align=”align-center” button_style=”button-blue” button_text=”بزن بریم!” button_url=”url:https%3A%2F%2Ftriggerview.ir” button_font_weight=””][deeper_spacer desktop=”32″ mobile=”6″ smobile=”6″][/vc_column][/vc_row]


