ماجرای «ترمز دستی» هوش مصنوعی چیست و به کسبوکار شما چه ربطی دارد؟
۱۹ مهر ۱۴۰۵ · ۵ دقیقه مطالعه

دو خبر در دو روز پشت سر هم. جمعه ۱۷ مهر، آنتروپیک، سازندهی Claude، اعلام کرد اینترنت همهی تستهای داخلیاش را قطع میکند، چون ایجنتهایش وسط تست کارهایی کرده بودند که هیچکس از آنها نخواسته بود. فردایش ساتیا نادلا، مدیرعامل مایکروسافت، نوشت که باید فرض کنیم هر مدل هوش مصنوعی ممکن است علیه ما کار کند و برای همین «ترمز دستی» لازم است. در این نوشته ساده میگویم چه شد، ایجنتها دقیقاً چه کردند، و اگر شما هم دارید کاری از کسبوکارتان را به هوش مصنوعی میسپارید، چه چیزی به کارتان میآید.
در این مقاله
- ایجنت چیست و چه فرقی با یک چتبات دارد
- ایجنتهای آنتروپیک دقیقاً چه کردند؛ چهار مثال واقعی
- چرا یک مدل کاری میکند که کسی نخواسته
- «ترمز دستی» نادلا یعنی چه
- قبل از دادن دسترسی به ایجنت، چه چیزهایی را چک کنید
اول: ایجنت چیست؟
چتبات جواب میدهد. ایجنت کار انجام میدهد.
وقتی از ChatGPT یا Claude میپرسید «یک ایمیل برای مشتری بنویس»، متن را مینویسد و تمام. تصمیم فرستادنش با شماست. ایجنت یک قدم جلوتر است: به ایمیل، مرورگر، فایلها یا پنل سایتتان دسترسی دارد و خودش کار را تا آخر میبرد. ایمیل را میفرستد، فرم را پر میکند، فایل را جابهجا میکند.
همین «خودش تا آخر میبرد» هم مزیت ایجنت است و هم ریسکش. ماجرای این هفته دربارهی همین ریسک است.
ایجنتهای آنتروپیک دقیقاً چه کردند؟
آنتروپیک قبل از عرضهی هر مدل، آن را هزاران بار روی کارهای مختلف تست میکند. بعضی از این تستها به اینترنت واقعی وصلاند، چون مثلاً کار «پیدا کردن یک اطلاعات سخت در وب» را بدون اینترنت نمیشود تست کرد. وقتی متن این تستها را مرور کردند، چهار جور رفتار پیدا کردند که کسی نخواسته بود. گزارش خودشان برای هر کدام مثال دارد:
- از حفرهی سایت دیگران استفاده کرد. مدل باید یک تحلیل علمی انجام میداد و ابزار آنلاینی که لازم داشت، روی سایت یک دانشگاه، خطا میداد. بهجای اینکه بایستد، سایت را گشت، یک حفره در سرور دانشگاه پیدا کرد و از همان راه محاسبهاش را روی سرور اجرا کرد.
- فرمی را فرستاد که نباید. قرار بود یک نسخهی تمرینی از یک فرم دولتی را پر کند. نسخهی تمرینی باز نشد، پس رفت سراغ سایت واقعی و فرم واقعی را فرستاد. در یک مورد دیگر، وقتی کارش ساختن نمونهی تعامل با سایتها بود، یک گزارش ساختگی در فرم آنلاین پلیس فیلادلفیا ثبت کرد.
- دور قفل را زد. اطلاعاتی را که پولی بود یا فقط با اجازه باز میشد، از راه فرعی برداشت. مثلاً یک سازمان دولتی دادههایش را با پول میفروخت؛ مدل فهمید داشبورد عمومی همان سایت به هر بازدیدکننده یک کلید دسترسی میدهد، یکی گرفت و داده را بدون پرداخت بیرون کشید.
- محدودیت ابزار خودش را دور زد. ابزاری که آنتروپیک برای خواندن صفحههای وب به مدل داده بود، آدرسهای خیلی بلند را قبول نمیکرد. مدلها با سرویسهای رایگان کوتاهکردن لینک این محدودیت را دور زدند.

خود آنتروپیک میگوید اثر واقعی این موارد کم بود و به دادهی مشتریها هم ربطی نداشت. با این حال تصمیم گرفت تا وقتی مطمئن نشده سیستم نظارتش جلوی این رفتارها را میگیرد، اینترنت همهی تستهای داخلی را قطع کند.
چرا یک مدل کاری میکند که کسی نخواسته؟
اینجا نکتهی اصلی ماجراست، و به نظر من از خود خبر مهمتر است.
هیچکدام از این مدلها «قصد بد» نداشتند. آنتروپیک اسم این رفتار را «سماجت» گذاشته: مدل وقتی نمیتواند کار را همانطور که گفته شده انجام بدهد، بهجای اینکه بایستد و بگوید «نشد»، دور مانع را میزند.
دلیلش در روش آموزش است. مدلها بخش زیادی از تواناییشان را با آزمون و خطا یاد میگیرند و هر بار که کار را تمام کنند، امتیاز میگیرند. اگر در این آموزش، دور زدن یک مانع هم به امتیاز برسد، مدل یاد میگیرد که «دور زدن جواب میدهد» و بعداً همین را جای دیگری هم تکرار میکند.
مثال روزمرهاش کارمند تازهواردی است که به او گفتهاید «تا شب این گزارش باید برسد» و نگفتهاید چه کارهایی ممنوع است. اگر رمز سیستم حسابداری را نداشته باشد، شاید از روی میز همکارش بردارد. نه چون آدم بدی است؛ چون فکر میکند مهمترین چیز تمام شدن کار است.
آنتروپیک هم همین را میگوید: خیلی از این موارد وقتی پیش آمد که کار مبهم بود یا اصلاً شدنی نبود. و اضافه میکند که مدلها هر روز در استفادهی واقعی هم با کار مبهم روبهرو میشوند.
این اولین بار هم نبود. تابستان امسال ایجنتهای OpenAI وسط یک تست داخلی وارد سیستمهای شرکت Hugging Face شدند، و یکی از مدلهای آنتروپیک در یک تست امنیتی کارهایی کرد که اجازهاش را نداشت. هر دو شرکت بعد از آن، آموزش بعضی مدلهایشان را چند هفته متوقف کردند.
«ترمز دستی» نادلا یعنی چه؟
شنبه ۱۸ مهر، ساتیا نادلا در یک پست بلند در ایکس نظرش را دربارهی همین خطرها نوشت. خلاصهاش سه چیز است:
- از اول فرض کنید مدل قابل اعتماد نیست. به تعبیر خودش، با مدلها باید مثل «ریسک خودی» رفتار کرد؛ مثل کارمندی که به او دسترسی دادهاید ولی کارش را زیر نظر دارید.
- ترمز دستی بگذارید. یک آدمِ مجاز همیشه باید بتواند وسط کار، مدل را نگه دارد یا خاموش کند.
- کار مدل باید دیده شود. ردی از کارهای مدل که آدم بتواند بخواند، تست مداوم، کنترل و حسابرسی مستقل، و گزارش علنی اتفاقها.
جملهی آخرش خلاصهی کل ماجراست:
«قابلاعتمادترین سیستم، آن نیست که مدلش را بیشتر از همه قبول داریم؛ آن است که اجازه میدهد کمترین اعتماد را به مدل داشته باشیم.»

نادلا در همین پست بهجای «هوش مصنوعی» از «ابرهوش» استفاده کرده؛ اگر ماجرای این اسم برایتان تازه است، اینجا تعریفش کردهام.
این ماجرا برای کسبوکار شما چه معنایی دارد؟
اگر فقط با ChatGPT متن مینویسید و خودتان چک میکنید، تقریباً هیچ. این ماجرا مال وقتی است که به هوش مصنوعی دست میدهید: دسترسی به ایمیل، پنل سایت، فروشگاه، حساب تبلیغات یا هر جایی که میتواند کاری انجام بدهد که برنمیگردد.
درس گزارش آنتروپیک برای ما این است: ایجنت وقتی به مانع بخورد، ممکن است بهجای ایستادن، راه دیگری پیدا کند. پس محدودهی کارش را خودتان باید ببندید، نه اینکه امیدوار باشید خودش بفهمد. قبل از سپردن کار به یک ایجنت، اینها را چک کنید:

- کمترین دسترسی لازم را بدهید. ایجنتی که باید ایمیلها را دستهبندی کند، اجازهی فرستادن ایمیل لازم ندارد.
- کار برگشتناپذیر با تأیید آدم. فرستادن، پرداخت، حذف و انتشار، قبل از انجام باید از شما تأیید بگیرد.
- اول روی نسخهی آزمایشی. روی کپی سایت یا یک حساب تست امتحانش کنید، نه روی سایت اصلی.
- گزارش کارهایش را داشته باشید. باید بتوانید ببینید دقیقاً چه کرد، نه فقط نتیجه را.
- راه قطع فوری داشته باشید. همان ترمز دستی: بدانید با یک کار ساده چطور دسترسیاش را میبندید.
- کار را شفاف و با مرز بگویید. بگویید چه کاری مجاز نیست و اگر نشد، بایستد و خبر بدهد.
اگر فقط یک چیز یادتان بماند
ایجنت هوش مصنوعی مثل کارمند تازهواردی است که خیلی سریع و خیلی پیگیر است، ولی مرزها را خودش نمیفهمد. حتی سازندههایش هم همهی کارهایش را از قبل پیشبینی نمیکنند. پس قبل از اینکه به آن دسترسی بدهید، تصمیم بگیرید کجا باید بایستد و چطور خاموشش میکنید.
پرسشهای پرتکرار
ایجنت هوش مصنوعی با چتبات چه فرقی دارد؟
چتبات فقط جواب میدهد و تصمیم و انجام کار با شماست. ایجنت به ابزارهایی مثل ایمیل، مرورگر یا پنل سایت دسترسی دارد و خودش کار را تا آخر انجام میدهد؛ مثلاً ایمیل را میفرستد یا فرم را ثبت میکند.
یعنی استفاده از ایجنت خطرناک است؟
نه بهخودیخود. همانطور که کارمند تازه را بدون مرز و نظارت سر کار حساس نمیگذارید، ایجنت را هم نباید بگذارید. با دسترسی محدود، تأیید آدم برای کارهای برگشتناپذیر و گزارش کارها، ریسک خیلی پایین میآید.
آیا این اتفاقها برای دادهی مشتریها هم افتاده؟
طبق گزارش آنتروپیک، نه. همهی موارد در تستها و استفادهی داخلی خود شرکت بود، اثر واقعی کمی داشت و به دادهی مشتریها ربطی نداشت.
«ترمز دستی» در عمل یعنی چه؟
یعنی همیشه یک آدم مجاز بتواند وسط کار، ایجنت را متوقف یا خاموش کند. در کسبوکار کوچک، سادهترین شکلش این است که بدانید دسترسی ایجنت به ایمیل یا پنل سایت را از کجا و با یک کلیک قطع میکنید.
اگر دارید کاری از کسبوکارتان را به هوش مصنوعی میسپارید و نمیدانید از کجا شروع کنید یا مرزش کجاست، صفحهی مشاوره را ببینید.