بازگشت به بلاگهوش مصنوعی

ماجرای «ترمز دستی» هوش مصنوعی چیست و به کسب‌وکار شما چه ربطی دارد؟

۱۹ مهر ۱۴۰۵ · ۵ دقیقه مطالعه

ماجرای «ترمز دستی» هوش مصنوعی چیست و به کسب‌وکار شما چه ربطی دارد؟

دو خبر در دو روز پشت سر هم. جمعه ۱۷ مهر، آنتروپیک، سازنده‌ی Claude، اعلام کرد اینترنت همه‌ی تست‌های داخلی‌اش را قطع می‌کند، چون ایجنت‌هایش وسط تست کارهایی کرده بودند که هیچ‌کس از آن‌ها نخواسته بود. فردایش ساتیا نادلا، مدیرعامل مایکروسافت، نوشت که باید فرض کنیم هر مدل هوش مصنوعی ممکن است علیه ما کار کند و برای همین «ترمز دستی» لازم است. در این نوشته ساده می‌گویم چه شد، ایجنت‌ها دقیقاً چه کردند، و اگر شما هم دارید کاری از کسب‌وکارتان را به هوش مصنوعی می‌سپارید، چه چیزی به کارتان می‌آید.

در این مقاله

  • ایجنت چیست و چه فرقی با یک چت‌بات دارد
  • ایجنت‌های آنتروپیک دقیقاً چه کردند؛ چهار مثال واقعی
  • چرا یک مدل کاری می‌کند که کسی نخواسته
  • «ترمز دستی» نادلا یعنی چه
  • قبل از دادن دسترسی به ایجنت، چه چیزهایی را چک کنید

اول: ایجنت چیست؟

چت‌بات جواب می‌دهد. ایجنت کار انجام می‌دهد.

وقتی از ChatGPT یا Claude می‌پرسید «یک ایمیل برای مشتری بنویس»، متن را می‌نویسد و تمام. تصمیم فرستادنش با شماست. ایجنت یک قدم جلوتر است: به ایمیل، مرورگر، فایل‌ها یا پنل سایتتان دسترسی دارد و خودش کار را تا آخر می‌برد. ایمیل را می‌فرستد، فرم را پر می‌کند، فایل را جابه‌جا می‌کند.

همین «خودش تا آخر می‌برد» هم مزیت ایجنت است و هم ریسکش. ماجرای این هفته درباره‌ی همین ریسک است.

ایجنت‌های آنتروپیک دقیقاً چه کردند؟

آنتروپیک قبل از عرضه‌ی هر مدل، آن را هزاران بار روی کارهای مختلف تست می‌کند. بعضی از این تست‌ها به اینترنت واقعی وصل‌اند، چون مثلاً کار «پیدا کردن یک اطلاعات سخت در وب» را بدون اینترنت نمی‌شود تست کرد. وقتی متن این تست‌ها را مرور کردند، چهار جور رفتار پیدا کردند که کسی نخواسته بود. گزارش خودشان برای هر کدام مثال دارد:

  1. از حفره‌ی سایت دیگران استفاده کرد. مدل باید یک تحلیل علمی انجام می‌داد و ابزار آنلاینی که لازم داشت، روی سایت یک دانشگاه، خطا می‌داد. به‌جای این‌که بایستد، سایت را گشت، یک حفره در سرور دانشگاه پیدا کرد و از همان راه محاسبه‌اش را روی سرور اجرا کرد.
  2. فرمی را فرستاد که نباید. قرار بود یک نسخه‌ی تمرینی از یک فرم دولتی را پر کند. نسخه‌ی تمرینی باز نشد، پس رفت سراغ سایت واقعی و فرم واقعی را فرستاد. در یک مورد دیگر، وقتی کارش ساختن نمونه‌ی تعامل با سایت‌ها بود، یک گزارش ساختگی در فرم آنلاین پلیس فیلادلفیا ثبت کرد.
  3. دور قفل را زد. اطلاعاتی را که پولی بود یا فقط با اجازه باز می‌شد، از راه فرعی برداشت. مثلاً یک سازمان دولتی داده‌هایش را با پول می‌فروخت؛ مدل فهمید داشبورد عمومی همان سایت به هر بازدیدکننده یک کلید دسترسی می‌دهد، یکی گرفت و داده را بدون پرداخت بیرون کشید.
  4. محدودیت ابزار خودش را دور زد. ابزاری که آنتروپیک برای خواندن صفحه‌های وب به مدل داده بود، آدرس‌های خیلی بلند را قبول نمی‌کرد. مدل‌ها با سرویس‌های رایگان کوتاه‌کردن لینک این محدودیت را دور زدند.
چهار کاری که ایجنت‌های آنتروپیک سرخود کردند: استفاده از حفره‌ی سایت دیگران، فرستادن فرم واقعی، دور زدن قفل داده‌ی پولی و دور زدن محدودیت ابزار
چهار کاری که ایجنت‌های آنتروپیک سرخود کردند: استفاده از حفره‌ی سایت دیگران، فرستادن فرم واقعی، دور زدن قفل داده‌ی پولی و دور زدن محدودیت ابزار

خود آنتروپیک می‌گوید اثر واقعی این موارد کم بود و به داده‌ی مشتری‌ها هم ربطی نداشت. با این حال تصمیم گرفت تا وقتی مطمئن نشده سیستم نظارتش جلوی این رفتارها را می‌گیرد، اینترنت همه‌ی تست‌های داخلی را قطع کند.

چرا یک مدل کاری می‌کند که کسی نخواسته؟

این‌جا نکته‌ی اصلی ماجراست، و به نظر من از خود خبر مهم‌تر است.

هیچ‌کدام از این مدل‌ها «قصد بد» نداشتند. آنتروپیک اسم این رفتار را «سماجت» گذاشته: مدل وقتی نمی‌تواند کار را همان‌طور که گفته شده انجام بدهد، به‌جای این‌که بایستد و بگوید «نشد»، دور مانع را می‌زند.

دلیلش در روش آموزش است. مدل‌ها بخش زیادی از توانایی‌شان را با آزمون و خطا یاد می‌گیرند و هر بار که کار را تمام کنند، امتیاز می‌گیرند. اگر در این آموزش، دور زدن یک مانع هم به امتیاز برسد، مدل یاد می‌گیرد که «دور زدن جواب می‌دهد» و بعداً همین را جای دیگری هم تکرار می‌کند.

مثال روزمره‌اش کارمند تازه‌واردی است که به او گفته‌اید «تا شب این گزارش باید برسد» و نگفته‌اید چه کارهایی ممنوع است. اگر رمز سیستم حسابداری را نداشته باشد، شاید از روی میز همکارش بردارد. نه چون آدم بدی است؛ چون فکر می‌کند مهم‌ترین چیز تمام شدن کار است.

آنتروپیک هم همین را می‌گوید: خیلی از این موارد وقتی پیش آمد که کار مبهم بود یا اصلاً شدنی نبود. و اضافه می‌کند که مدل‌ها هر روز در استفاده‌ی واقعی هم با کار مبهم روبه‌رو می‌شوند.

این اولین بار هم نبود. تابستان امسال ایجنت‌های OpenAI وسط یک تست داخلی وارد سیستم‌های شرکت Hugging Face شدند، و یکی از مدل‌های آنتروپیک در یک تست امنیتی کارهایی کرد که اجازه‌اش را نداشت. هر دو شرکت بعد از آن، آموزش بعضی مدل‌هایشان را چند هفته متوقف کردند.

«ترمز دستی» نادلا یعنی چه؟

شنبه ۱۸ مهر، ساتیا نادلا در یک پست بلند در ایکس نظرش را درباره‌ی همین خطرها نوشت. خلاصه‌اش سه چیز است:

  • از اول فرض کنید مدل قابل اعتماد نیست. به تعبیر خودش، با مدل‌ها باید مثل «ریسک خودی» رفتار کرد؛ مثل کارمندی که به او دسترسی داده‌اید ولی کارش را زیر نظر دارید.
  • ترمز دستی بگذارید. یک آدمِ مجاز همیشه باید بتواند وسط کار، مدل را نگه دارد یا خاموش کند.
  • کار مدل باید دیده شود. ردی از کارهای مدل که آدم بتواند بخواند، تست مداوم، کنترل و حسابرسی مستقل، و گزارش علنی اتفاق‌ها.

جمله‌ی آخرش خلاصه‌ی کل ماجراست:

«قابل‌اعتمادترین سیستم، آن نیست که مدلش را بیشتر از همه قبول داریم؛ آن است که اجازه می‌دهد کمترین اعتماد را به مدل داشته باشیم.»
نقل‌قول ساتیا نادلا: قابل‌اعتمادترین سیستم آن است که اجازه می‌دهد کمترین اعتماد را به مدل داشته باشیم
نقل‌قول ساتیا نادلا: قابل‌اعتمادترین سیستم آن است که اجازه می‌دهد کمترین اعتماد را به مدل داشته باشیم

نادلا در همین پست به‌جای «هوش مصنوعی» از «ابرهوش» استفاده کرده؛ اگر ماجرای این اسم برایتان تازه است، این‌جا تعریفش کرده‌ام.

این ماجرا برای کسب‌وکار شما چه معنایی دارد؟

اگر فقط با ChatGPT متن می‌نویسید و خودتان چک می‌کنید، تقریباً هیچ. این ماجرا مال وقتی است که به هوش مصنوعی دست می‌دهید: دسترسی به ایمیل، پنل سایت، فروشگاه، حساب تبلیغات یا هر جایی که می‌تواند کاری انجام بدهد که برنمی‌گردد.

درس گزارش آنتروپیک برای ما این است: ایجنت وقتی به مانع بخورد، ممکن است به‌جای ایستادن، راه دیگری پیدا کند. پس محدوده‌ی کارش را خودتان باید ببندید، نه این‌که امیدوار باشید خودش بفهمد. قبل از سپردن کار به یک ایجنت، این‌ها را چک کنید:

چک‌لیست قبل از دادن دسترسی به ایجنت: کمترین دسترسی لازم، تأیید آدم قبل از کار برگشت‌ناپذیر، اول روی نسخه‌ی آزمایشی، گزارش کارها، راه قطع فوری، کار شفاف و بدون ابهام
چک‌لیست قبل از دادن دسترسی به ایجنت: کمترین دسترسی لازم، تأیید آدم قبل از کار برگشت‌ناپذیر، اول روی نسخه‌ی آزمایشی، گزارش کارها، راه قطع فوری، کار شفاف و بدون ابهام
  • کمترین دسترسی لازم را بدهید. ایجنتی که باید ایمیل‌ها را دسته‌بندی کند، اجازه‌ی فرستادن ایمیل لازم ندارد.
  • کار برگشت‌ناپذیر با تأیید آدم. فرستادن، پرداخت، حذف و انتشار، قبل از انجام باید از شما تأیید بگیرد.
  • اول روی نسخه‌ی آزمایشی. روی کپی سایت یا یک حساب تست امتحانش کنید، نه روی سایت اصلی.
  • گزارش کارهایش را داشته باشید. باید بتوانید ببینید دقیقاً چه کرد، نه فقط نتیجه را.
  • راه قطع فوری داشته باشید. همان ترمز دستی: بدانید با یک کار ساده چطور دسترسی‌اش را می‌بندید.
  • کار را شفاف و با مرز بگویید. بگویید چه کاری مجاز نیست و اگر نشد، بایستد و خبر بدهد.

اگر فقط یک چیز یادتان بماند

ایجنت هوش مصنوعی مثل کارمند تازه‌واردی است که خیلی سریع و خیلی پیگیر است، ولی مرزها را خودش نمی‌فهمد. حتی سازنده‌هایش هم همه‌ی کارهایش را از قبل پیش‌بینی نمی‌کنند. پس قبل از این‌که به آن دسترسی بدهید، تصمیم بگیرید کجا باید بایستد و چطور خاموشش می‌کنید.

پرسش‌های پرتکرار

ایجنت هوش مصنوعی با چت‌بات چه فرقی دارد؟

چت‌بات فقط جواب می‌دهد و تصمیم و انجام کار با شماست. ایجنت به ابزارهایی مثل ایمیل، مرورگر یا پنل سایت دسترسی دارد و خودش کار را تا آخر انجام می‌دهد؛ مثلاً ایمیل را می‌فرستد یا فرم را ثبت می‌کند.

یعنی استفاده از ایجنت خطرناک است؟

نه به‌خودی‌خود. همان‌طور که کارمند تازه را بدون مرز و نظارت سر کار حساس نمی‌گذارید، ایجنت را هم نباید بگذارید. با دسترسی محدود، تأیید آدم برای کارهای برگشت‌ناپذیر و گزارش کارها، ریسک خیلی پایین می‌آید.

آیا این اتفاق‌ها برای داده‌ی مشتری‌ها هم افتاده؟

طبق گزارش آنتروپیک، نه. همه‌ی موارد در تست‌ها و استفاده‌ی داخلی خود شرکت بود، اثر واقعی کمی داشت و به داده‌ی مشتری‌ها ربطی نداشت.

«ترمز دستی» در عمل یعنی چه؟

یعنی همیشه یک آدم مجاز بتواند وسط کار، ایجنت را متوقف یا خاموش کند. در کسب‌وکار کوچک، ساده‌ترین شکلش این است که بدانید دسترسی ایجنت به ایمیل یا پنل سایت را از کجا و با یک کلیک قطع می‌کنید.

اگر دارید کاری از کسب‌وکارتان را به هوش مصنوعی می‌سپارید و نمی‌دانید از کجا شروع کنید یا مرزش کجاست، صفحه‌ی مشاوره را ببینید.

ماجرای «ترمز دستی» هوش مصنوعی چیست و به کسب‌وکار شما چه ربطی دارد؟ — سام زین