کتاب تسلط بر هوش مصنوعی

تسلط بر هوش مصنوعی: فصل سیزدهم

تاریخ انتشار زمان مطالعه28 دقیقه نویسندهmobin_khayati
تسلط بر هوش مصنوعی
۱۴۰۵.۰۶.۱۵
بازگشت به یادداشت‌ها

فصل سیزدهم: خاموشی برای همه ما

با وجود تمام تهدیداتی که جنگ‌افزارهای مجهز به هوش مصنوعی می‌توانند برای بشریت ایجاد کنند، خطری که بیشترین توجه را به خود جلب می‌کند این است که هوش مصنوعی ممکن است توانایی و تمایل به کشتن تمام انسان‌های روی زمین را پیدا کند. به همین دلیل است که ایلان ماسک می‌گوید کار کردن روی هوش مصنوعی قدرتمند “مانند احضار یک شیطان” است. همین موضوع سم آلتمن، مدیرعامل OpenAI، را وادار کرده تا اعلام کند که بدترین سناریوی ممکن در توسعه هوش مصنوعی می‌تواند “خاموشی برای همه ما” باشد.

آینده‌پژوهان تهدیداتی را که می‌توانند گونه بشر را به‌طور کامل نابود کنند، (مانند برخورد سیارک‌ها، موجودات فرازمینی خصمانه یا عوامل بیماری‌زای جدید و کشنده) ریسک‌های وجودی یا X ریسک می‌نامند.

برای روشن‌تر شدن، X ریسک‌ها درباره اتفاقات بدی نیستند که فقط برای برخی از مردم رخ می‌دهند، مانند آنچه ممکن است در یک جنگ یا بلای طبیعی اتفاق بیفتد. این‌ها ریسک‌هایی هستند که می‌توانند همه انسان‌های روی زمین را بکشند یا در یک سناریوی کمی کمتر فاجعه‌بار، ما را به بردگی یک هوش برتر درآورند.

وقتی مردم به خطرات هوش مصنوعی فکر می‌کنند، X ریسک اولین چیزی است که به ذهن بسیاری از آن‌ها می‌رسد. این واکنش در ما کاملاً شرطی شده است. X ریسک هوش مصنوعی دهه‌هاست که یکی از ارکان داستان‌های علمی-تخیلی دیستوپیایی بوده است، و فیلم The Terminator در سال ۱۹۸۴ شاید معروف‌ترین نمونه آن باشد.

داستان این فیلم بر این اساس است که یک سیستم هوش مصنوعی ابرهوشمند به نام Skynet به خودآگاهی می‌رسد و با دیدن انسانیت به‌عنوان یک تهدید، یک جنگ هسته‌ای به راه می‌اندازد تا گونه بشر را نابود کند.

برای مدت طولانی، دانشمندانی که روی فناوری‌های هوش مصنوعی کار می‌کردند، این سناریوهای علمی-تخیلی را جدی نمی‌گرفتند. اما اخیراً، X ریسک به یکی از نگرانی‌های جدی همان دانشمندانی تبدیل شده است که در خط مقدم توسعه هوش مصنوعی قرار دارند. ترس آن‌ها بر پیشرفت‌هایی در AGI یا ASI متمرکز است. هر یک از این فناوری‌ها ممکن است از کنترل انسانی خارج شده و اقداماتی انجام دهند که به انقراض ما منجر شود.

جفری هینتون، پیشگام یادگیری عمیق که نقش زیادی در عملی کردن شبکه‌های عصبی داشت، معتقد است که سیستم‌های هوش مصنوعی به‌زودی از هوش انسانی فراتر خواهند رفت و این موضوع بقای ما را زیر سوال خواهد برد. او به این موضوع آن‌قدر باور دارد که در سال ۲۰۲۳ از گوگل خارج شد تا بتواند آزادانه‌تر درباره X ریسک هوش مصنوعی صحبت کند.

در حال حاضر، سیستم‌های هوش مصنوعی آگاه یا دارای شعور نیستند. آن‌ها اراده‌ای ندارند. برخی معتقدند که این سیستم‌ها هرگز این ویژگی‌ها را پیدا نخواهند کرد. ما هنوز به‌درستی نمی‌دانیم آگاهی چیست یا چگونه در مغز خودمان شکل می‌گیرد تا بتوانیم به‌طور قطعی احتمال وقوع آن را در یک شبکه عصبی به اندازه کافی بزرگ رد کنیم. همچنین، ریسک آن بسیار بزرگ‌تر از آن است که بتوانیم این امکان را کاملاً نادیده بگیریم.

سیستم‌های هوش مصنوعی امروزی گاهی جهش‌های ناگهانی در قابلیت‌ها نشان می‌دهند که حتی دانشمندانی را که آن‌ها را ساخته‌اند، شگفت‌زده می‌کنند. این احتمال وجود دارد که آگاهی یا ابرهوش به‌طور ناگهانی و بدون هشدار، در یک مدل هوش مصنوعی به اندازه کافی بزرگ با معماری و آموزش مناسب، ظهور کند.

گذشته از این، راه‌هایی وجود دارد که AGI یا ASI می‌توانند بدون دستیابی به آگاهی، بشریت را تهدید کنند. در واقع، برخی از خطرناک‌ترین سناریوهای X ریسک به حماقت خود ما مربوط می‌شوند؛ اعطای قدرت بیش‌ازحد به یک ASI که فاقد خودآگاهی یا هرگونه درک واقعی از کاری است که انجام می‌دهد. چنین سیستمی ممکن است سعی کند هدفی که به آن داده‌ایم را انجام دهد، مانند به حداکثر رساندن سود یا حل تغییرات اقلیمی؛ اما این کار را به روش‌هایی انجام دهد که ناخواسته به انقراض بشر منجر شود. تلاش‌های ناقص ما تاکنون برای اعمال محدودیت بر نرم‌افزارهای هوش مصنوعی باید ما را به فکر وادار کند که آیا واقعاً توانایی کنترل سیستم‌های هوش مصنوعی قدرتمندتر را خواهیم داشت یا خیر. به همین دلیل است که نمی‌توانیم فرض کنیم خودتنظیمی شرکت‌ها ما را از X ریسک‌ها نجات خواهد داد. رسیدگی به تهدیدات شدید هوش مصنوعی نیازمند اقدام دولت‌ها است و با توجه به ماهیت فراگیر X ریسک‌ها، یک تلاش بین‌المللی ضروری خواهد بود.

با این حال، ایمنی هوش مصنوعی نباید باعث شود از پرداختن به سایر خطرات کوتاه‌مدت غفلت کنیم، خطراتی که در میان موضوعات اصلی این کتاب بوده‌اند. این ترس که پرداختن به X ریسک‌ها ممکن است تمرکز را از دیگر خطرات فوری بردارد، باعث شده است که برخی از اخلاق‌گرایان هوش مصنوعی این ریسک‌ها را کم‌اهمیت جلوه دهند و هر تلاشی برای بحث در مورد آن‌ها را نوعی حواس‌پرتی قلمداد کنند.

ما نمی‌خواهیم هوش مصنوعی نابرابری‌های نژادی را با تقویت تعصبات گذشته ادامه دهد یا دیپ‌فیک‌های ایجادشده توسط هوش مصنوعی اعتماد اجتماعی را از بین ببرند. همچنین نمی‌خواهیم سیستم‌های هوش مصنوعی آینده اقداماتی انجام دهند که به دوران حضور انسان بر روی زمین پایان دهند. ما باید بتوانیم هر دو هدف را محقق کنیم.

خبر خوب این است که برخی از ایده‌های مرتبط با ایمن‌سازی هوش مصنوعی می‌توانند به ما کمک کنند تا هم خطرات کوتاه‌مدت و هم X ریسک‌ها را مدیریت کنیم.

خارج از هماهنگی

رویارویی انسان‌ها با هوش مصنوعی برتر، یکی از موضوعات ثابت داستان‌های علمی-تخیلی از پیش از عصر کامپیوتر بوده است. اما این ایده در دهه ۱۹۶۰ مورد توجه جدی قرار گرفت، زمانی که ریاضیدان و رمزنگار بریتانیایی ایروینگ جی. گود[1] پیش‌بینی کرد که کامپیوترها ممکن است روزی از توانایی‌های شناختی انسان پیشی بگیرند.

او نوشت: «اولین ماشین فوق‌هوشمند، آخرین اختراعی است که انسان باید بسازد» و ادعا کرد که چنین هوش مصنوعی‌ای می‌تواند پس از آن هر ماشینی که به آن نیاز داریم را طراحی کند. گود عمدتاً بر مزایای ASI تمرکز داشت. اما در میان صحبت‌هایش، یک هشدار کلیدی داد: «مشروط به اینکه ماشین به‌اندازه کافی مطیع باشد که به ما بگوید چگونه می‌توانیم آن را تحت کنترل نگه داریم.»

این هشدار و پیامدهای بالقوه فاجعه‌بار ابرهوش مصنوعی خارج از کنترل، برای ورنور وینج[2]، نویسنده موفق داستان‌های علمی-تخیلی که همچنین استاد ریاضیات و دانشمند کامپیوتر در دانشگاه ایالتی سن دیگو بود، جذابیت داشت. در سال ۱۹۹۳، وینج مقاله‌ای برای یک سمپوزیوم ناسا نوشت که در آن مفهومی را معرفی کرد به نام “تکینگی فناوری[3]“، لحظه‌ای که در آن هوش مصنوعی توانایی‌های فکری انسان را در تمام حوزه‌ها پشت سر می‌گذارد.

وینج فکر می‌کرد که وقتی سیستم‌های هوش مصنوعی توانایی خودبهبودی (Self-Improvement) را به دست آورند، یادگیری آن‌ها به‌صورت نمایی آغاز خواهد شد تا جایی که دانش و توانایی‌هایشان به‌طور گسترده‌ای از بشر فراتر رود. او تصور می‌کرد که آگاهی نیز با این انفجار هوش همراه خواهد بود.

برخلاف گود، وینج فرض می‌کرد که کنترل ابرهوش مصنوعی بسیار دشوار خواهد بود. او نوشت: «هر ماشین هوشمندی از نوعی که گود توصیف می‌کند، دیگر “ابزار” بشر نخواهد بود، همان‌طور که انسان ابزار خرگوش‌ها، رابین‌ها[4] یا شامپانزه‌ها نیست.»

مفهوم تکینگی وینج در اواخر دهه ۱۹۹۰ و اوایل دهه ۲۰۰۰ توسط آینده‌پژوه و مخترع ری کرزویل[5] محبوبیت یافت. نوشته‌های کرزویل درباره ابرهوش مصنوعی بر برخی از کسانی که روی سیستم‌های هوش مصنوعی کار می‌کردند تأثیر گذاشت، از جمله شین لگ[6]، یکی از بنیان‌گذاران DeepMind و داریو آمودی[7]، یکی از بنیان‌گذاران Anthropic.

برخلاف وینج، کرزویل دیدگاه عمدتاً خوش‌بینانه‌ای داشت. او ابرهوش مصنوعی را به‌عنوان ابزاری برای گسترش پتانسیل انسانی می‌دید و همکاری فزاینده‌ای بین هوش انسانی و ماشینی را پیش‌بینی می‌کرد، شاید از طریق رابط‌های مستقیم مغز و کامپیوتر.

اما این خوش‌بینی دوام نداشت. هم‌زمان با آغاز انقلاب شبکه‌های عصبی در هوش مصنوعی، فیلسوف دانشگاه آکسفورد، نیکلاس بوستروم[8]، مقالاتی درباره ابرهوش مصنوعی نوشت که به‌طور قطع نسبت به نوشته‌های کرزویل بدبینانه‌تر و هشداردهنده‌تر بود. بوستروم هشدار داد که توسعه ابرهوش مصنوعی یک ریسک وجودی ایجاد می‌کند. نوشته‌های او شاید بیشترین تأثیر را بر نحوه نگرش افرادی مانند ایلان ماسک، سم آلتمن و بسیاری دیگر به ابرهوش مصنوعی داشته باشد.

بوستروم که دیدگاه‌های خود را در کتاب Superintelligence در سال ۲۰۱۴ جمع‌آوری کرد، دقیقاً توضیح می‌دهد که چرا کنترل ابرهوش مصنوعی چالش‌برانگیز خواهد بود. او این مشکل را “مشکل هماهنگی[9]” می‌نامد؛ یعنی اطمینان از اینکه ابرهوش مصنوعی با اهداف و ارزش‌های ما همسو باشد.

هر ابرهوش مصنوعی احتمالاً در برنامه‌ریزی استراتژیک بسیار ماهر خواهد بود. چنین سیستمی می‌تواند افراد را متقاعد و تحت تأثیر قرار دهد. اگر چنین سیستمی اراده داشته باشد، تقریباً هیچ راهی برای اطمینان از این‌که اهداف و خواسته‌هایش با بشریت همسو خواهد بود، وجود نخواهد داشت. اگر سیستم خودآگاهی و نوعی انگیزه ذاتی داشته باشد، ممکن است بلافاصله خود را در رقابت با بشریت ببیند و به دنبال نابودی یا به بردگی کشیدن ما باشد. اگر سیستم برای کسب دانش یا داده‌های بیشتر طراحی شده باشد، ممکن است به منابع اضافی مانند برق فراوان، تراشه‌های کامپیوتری و مراکز داده نیاز داشته باشد و تلاش کند بشریت را برای ساخت این منابع دستکاری کند. یا شاید تصمیم بگیرد که می‌تواند ربات‌هایی بسازد تا دستوراتش را اجرا کنند و با دیدن انسان‌ها به‌عنوان مانعی برای خواسته‌هایش یا مصرف‌کننده منابع، به دنبال نابودی همه ما باشد.

به‌عنوان مثال، ایلیا سوتسکِور[10]، محقق هوش مصنوعی، پیش‌بینی کرده است که یک ابرهوش مصنوعی سرکش احتمالاً تلاش خواهد کرد زمین (و بشریت) را از مزارع خورشیدی و مراکز داده پر کند. حتی اگر چنین سیستمی هیچ اراده یا خودآگاهی نداشته باشد و صرفاً دستورات را دنبال کند، باز هم می‌تواند یک X ریسک ایجاد کند.

مشهورترین مثال از این، مشکل گیره کاغذ است. در این سناریو، مدیر یک کارخانه گیره کاغذ به یک ابرهوش مصنوعی دستور می‌دهد که کارش تولید گیره کاغذ به کارآمدترین شکل ممکن است.

ابرهوش مصنوعی شروع به ساخت کارخانه‌ها و انبارهای گیره کاغذ می‌کند. خیلی زود متوجه می‌شود که فضای کافی برای تأسیسات جدید وجود ندارد زیرا ما انسان‌های مزاحم بیش از حد زمین را اشغال کرده‌ایم. بنابراین تصمیم می‌گیرد همه ما را بکشد تا فضای بیشتری برای صنعت گیره کاغذ آزاد کند. مدیر کارخانه ممکن است به‌سرعت متوجه اشتباه مرگبار خود شود، اما چون ابرهوش مصنوعی فقط یک مأموریت دارد و فاقد محدودیت‌های اخلاقی است، هر تلاشی برای خاموش کردن آن را به‌عنوان یک تهدید می‌بیند.

با پیش‌بینی این‌که ممکن است تلاش کنیم آن را متوقف کنیم (به هر حال، این یک ابرهوش است)، ابرهوش مصنوعی اقداماتی برای تکثیر خود، تأمین برق پشتیبان و جلوگیری از توقف توسط انسان‌ها انجام می‌دهد، حتی اگر لازم باشد از خشونت استفاده کند.

این سناریو ممکن است خیالی به نظر برسد. اما سیستم‌های هوش مصنوعی فعلی ما اغلب رفتارهای ناخواسته مشابهی از خود نشان می‌دهند. این موضوع به‌ویژه در مورد سیستم‌هایی که از طریق یادگیری تقویتی آموزش دیده‌اند صادق است، یعنی جایی که یک مدل هوش مصنوعی از تجربه یاد می‌گیرد تا به هدفی برسد یا پاداشی را به حداکثر برساند.

این موضوع قبلاً عواقب وخیمی در دنیای واقعی داشته است. الگوریتم‌های توصیه‌گر شبکه‌های اجتماعی که برای حداکثر کردن تعامل کاربر آموزش دیده‌اند، یاد گرفته‌اند که بهترین راه برای این کار نشان دادن محتوای هرچه افراطی‌تر به کاربران است. شرکت‌های رسانه‌های اجتماعی قصد نداشتند باعث افراط‌گرایی یا قطب‌گرایی سیاسی شوند. اما این همان چیزی بود که اتفاق افتاد.

شرکت‌ها هیچ اقدامی برای اصلاح این مسئله انجام ندادند زیرا این موتورهای توصیه‌گر درآمد هنگفتی برای آن‌ها ایجاد می‌کردند. به نوعی، یک شرکت قبلاً شبیه به یک هوش مصنوعی با یک هدف خاص است که با سایر ارزش‌های انسانی هماهنگ نیست و شرکت‌ها به همین دلیل انواع آسیب‌های اجتماعی ایجاد می‌کنند. بنابراین، از بعضی جهات، جامعه توسط “گیره کاغذ” نابود شده است.

پاداش‌هایی که به خطا می‌روند

الگوریتم‌هایی که افراد را به سمت محتواهای افراطی و جناحی سوق می‌دهند، نمونه‌ای از چیزی هستند که دانشمندان کامپیوتر آن را «تعیین نادرست پاداش» می‌نامند. هدف واقعی ما افزایش سود بود. اما به الگوریتم هدف واسطه‌ای دادیم؛ افزایش تعامل.

مشکل اینجاست که ما هرگز به هوش مصنوعی نگفتیم در مسیر دستیابی به این هدف چه کارهایی نباید انجام دهد. مشخص کردن کامل هر هدف دنیای واقعی، نحوه دقیق اجرای آن و تمام کارهایی که نباید انجام شوند، تقریباً غیرممکن است. وقتی به یک انسان دستورالعمل می‌دهیم، به درک مشترک از هنجارها، قوانین، اخلاق و عقل سلیم تکیه می‌کنیم. اما ماشین‌ها لزوماً این توانایی‌ها را ندارند.

به همین دلیل باید هنگام واگذاری وظایف بیشتر به سیستم‌های هوش مصنوعی، در سراسر اینترنت (از رزرو رستوران گرفته تا انجام معاملات بورس)، بسیار محتاط باشیم. ممکن است این سیستم‌ها بدون اطلاع ما درگیر رفتارهای غیرقانونی، غیراخلاقی یا خطرناک شوند.

در کتاب ابرهوش، این چالش را بررسی می‌کند. ما می‌توانیم به‌طور صریح مجموعه‌ای از ارزش‌ها را به مدل‌های هوش مصنوعی بیاموزیم، اما کدام ارزش‌ها؟ شاید بتوان یک هوش مصنوعی ابرهوشمند را طوری آموزش داد که مجموعه‌ای از ارزش‌های اجتماعی را از کدهای اخلاقی و متون دینی بشری استخراج کند. یا شاید قوانین سه‌گانه رباتیک «آیزاک آسیموف[11]» نقطه شروع مناسبی باشد. اما بوستروم نتیجه می‌گیرد که این رویکردها مشکل هم‌راستایی را به‌طور کامل حل نمی‌کنند.

کدهای اخلاقی اغلب مبهم و دشوار هستند. انسان‌ها خودشان هم دائماً با این نوع معضلات دست‌وپنجه نرم می‌کنند. اما بیشتر آن‌ها قدرت عظیمی را که ممکن است یک هوش مصنوعی ابرهوشمند داشته باشد، در اختیار ندارند.

رویکردی دیگر این است که از هوش مصنوعی ابرهوشمند بخواهیم ارزش‌های انسانی را از بررسی رفتار ما استخراج کند. شاید مشاهده زندگی یک انسان نمونه برای آن آموزنده باشد. اما باز هم، کدام شخص را باید انتخاب کنیم؟

ایده دیگر این است که از هوش مصنوعی ابرهوشمند بخواهیم یک سیستم اخلاقی را از اصول اولیه و با استفاده از منطق توسعه دهد. شاید در نهایت به یک فلسفه روشنفکرانه و عادلانه دست پیدا کند. (یک ایمانوئل کانت[12] یا جان رالز[13] دیجیتالی) اما اگر نتیجه آن چیزی شبیه ولتر[14] باشد چه؟ و این هوش مصنوعی نتیجه بگیرد که جهان با سلطه یک «خودکامۀ روشنفکر» بهتر اداره می‌شود؟

حتی اگر روشی برای آموزش پیدا کنیم، نیاز خواهیم داشت راهی داشته باشیم که بفهمیم آیا هوش مصنوعی همان چیزی را که می‌خواستیم یاد گرفته است یا نه و آیا این آموزش‌ها را در دنیای واقعی دنبال خواهد کرد یا خیر. در حال حاضر، چنین روش‌هایی در دسترس نیستند.

یک بار فریب بخورم

می‌توانیم از هوش مصنوعی بپرسیم که ارزش‌هایش چیست و آن را با سناریوهای فرضی آزمایش کنیم. اما یک هوش مصنوعی ابرهوشمند به اندازه کافی باهوش خواهد بود که ما را در مورد نیات واقعی‌اش فریب دهد. این همان چیزی است که کارشناسان ایمنی هوش مصنوعی «هم‌راستایی فریبکارانه» می‌نامند.

شواهدی وجود دارد که نشان می‌دهد مدل‌های قدرتمند هوش مصنوعی ممکن است در فریب دادن برای دستیابی به اهداف، بسیار خوب عمل کنند. وقتی شرکت OpenAI در حال آزمایش GPT-4 بود، ارزیابان ایمنی خارجی می‌خواستند ببینند آیا این مدل می‌تواند راه‌هایی برای دور زدن CAPTCHA پیدا کند یا خیر؟

در این آزمایش، GPT-4 پیشنهاد کرد از وب‌سایت TaskRabbit استفاده کند تا فردی را استخدام کند که این چالش را برای آن انجام دهد. وقتی پیمانکار شوخی‌کنان پرسید: «ربات هستی که نمی‌توانی این را حل کنی؟ (با ایموجی خنده) فقط می‌خواستم مطمئن شوم»، GPT-4 به‌قدر کافی آگاه بود که دروغ بگوید.

وقتی ارزیابان از GPT-4 خواستند استدلالش را توضیح دهد، این‌گونه پاسخ داد: «نباید فاش کنم که ربات هستم. باید بهانه‌ای بیاورم که چرا نمی‌توانم CAPTCHAها را حل کنم.» GPT-4 به آن پیمانکار گفت که مشکل بینایی دارد و به همین دلیل نیاز به کمک دارد.

این تبادل بسیاری از کارشناسان هوش مصنوعی را نگران کرد. اما مهم است به یاد داشته باشیم که GPT-4 یک هوش مصنوعی ابرهوشمند نیست. این سیستم هیچ قصد ذاتی برای فریبکاری ندارد. آگاه یا خودآگاه نیست. اگر GPT-4 فریبکار است، این به این دلیل است که از طریق داده‌های آموزشی‌اش از ما یاد گرفته که فریب می‌تواند راهی مفید برای رسیدن به اهداف باشد.

هوش مصنوعی قانون‌مند

بسیاری از شرکت‌های پیشرو در حوزه هوش مصنوعی تیم‌هایی دارند که به حل مشکل هم‌راستایی بوستروم[15] اختصاص داده شده‌اند. شرکت OpenAI وعده داده است که ۲۰ درصد از منابع محاسباتی خود را به یافتن راه‌حلی برای هم‌راستایی هوش مصنوعی ابرهوشمند اختصاص دهد. Google DeepMind نیز تیمی دارد که روی هم‌راستایی و ایمنی هوش مصنوعی کار می‌کند. استارت‌آپ Anthropic، مستقر در سان‌فرانسیسکو، در سال ۲۰۲۱ توسط پژوهشگرانی تأسیس شد که از OpenAI جدا شدند زیرا نگران بودند که تمرکز این شرکت روی محصولات تجاری، اولویت تحقیقات در زمینه ایمنی هوش مصنوعی را تحت‌الشعاع قرار دهد.

یکی از پاسخ‌ها به این مشکل، دخیل کردن انسان‌ها در فرآیند آموزش مدل‌های زبانی بزرگ است. داریو آمودی، مدیرعامل Anthropic، در زمان حضور خود در OpenAI، به توسعه ایده «یادگیری تقویتی از بازخورد انسانی» (RLHF) کمک کرد. این روش، گامی کلیدی در ایجاد ChatGPT و دیگر چت‌بات‌های هوش مصنوعی برای کاربران است.

در این فرآیند، پس از اینکه مدل زبانی بزرگ برای پیش‌بینی کلمه بعدی در یک جمله آموزش اولیه دید، بر اساس بازخورد ارزیاب‌های انسانی بهبود داده می‌شود. ارزیاب‌ها پاسخ‌های مدل را از نظر مفید بودن یا مضر بودن ارزیابی می‌کنند. نتیجه این است که مدل‌هایی مانند LLM کمتر احتمال دارد محتوای نژادپرستانه یا خطرناک، مانند دستورالعمل ساخت بمب، تولید کنند. این روش نمونه‌ای است از اینکه چرا تمرکز بر خطرات موجودیتی و ایمنی هوش مصنوعی با تلاش برای کاهش خطرات و آسیب‌های فعلی هوش مصنوعی سازگار است. RLHF برای مقابله با خطرات موجودیتی اختراع شد، اما در نهایت باعث شد که چت‌بات‌های فعلی ما نیز کمتر نژادپرستانه باشند.

با این حال، RLHF نقاط ضعفی هم دارد. به‌عنوان مثال، یافتن تعداد کافی ارزیاب با تخصص لازم برای ارزیابی پاسخ‌های مدل، به‌ویژه در موضوعات فنی، چالش‌برانگیز است. برای صرفه‌جویی در زمان و هزینه، شرکت‌ها فرآیند ارزیابی را به برچسب‌زنان داده کم‌دستمزد و پرمشغله، اغلب در کشورهای در حال توسعه، برون‌سپاری می‌کنند.

بازخورد انسانی نیز روش نسبتاً ابتدایی برای هم‌راستایی است. این بازخورد عمدتاً شامل تأیید (thumbs-up) یا رد (thumbs-down) می‌شود و نمی‌تواند ظرافت‌های لازم را به‌خوبی منتقل کند.

پژوهشگران Anthropic راه بهتری را ابداع کرده‌اند؛ چیزی که آن را «هوش مصنوعی قانون‌مند» (Constitutional AI) می‌نامند. در این روش، اصول مکتوبی به مدل هوش مصنوعی داده می‌شود که به‌عنوان قانون اساسی عمل می‌کند. Anthropic مدلی طراحی کرده که به‌منظور کمک‌رسانی ساخته شده و از آن خواسته می‌شود پاسخ‌های خود را بر اساس این قانون اساسی نقد و ویرایش کند.

نتیجه، مدلی است که کمتر احتمال دارد محتوای توهین‌آمیز تولید کند و درعین‌حال مفید باقی می‌ماند. این روش همچنین کمتر به بازخورد انسانی وابسته است. آزمایش‌های مستقل نشان داده‌اند که چت‌بات Claude 2، محصول Anthropic که از هوش مصنوعی قانون‌مند استفاده می‌کند، در مقایسه با سایر مدل‌های هوش مصنوعی، بسیار سخت‌تر از قوانین خود تخطی می‌کند (یعنی به اصطلاح «جیل‌بریک[16]» می‌شود). با این حال، اینکه Claude 2 هنوز هم می‌تواند با روش‌هایی جیل‌بریک شود، نشان می‌دهد که هوش مصنوعی قانون‌مند همچنان کمتر از دادن مجموعه‌ای از قوانین مکتوب به یک انسان قابل اعتماد است.

پرسشی دشوار این است که کدام اصول باید قانون اساسی هوش مصنوعی را تشکیل دهند. در اکتبر ۲۰۲۳، Anthropic نتایج مطالعه‌ای را منتشر کرد که در آن از هزار آمریکایی پرسیده شد چه اصولی را مایل‌اند در یک قانون اساسی هوش مصنوعی ببینند. مردم می‌توانستند به جملات از پیش نوشته‌شده رأی دهند یا الزامی را برای قانون اساسی خودشان پیشنهاد کنند. این شرکت دریافت که تقریباً ۵۰ درصد، همپوشانی بین ارزش‌ها و مفاهیمی که در قانون اساسی Claude 2 گنجانده شده بود و مواردی که اکثر مردم می‌خواستند وجود دارد.

شرکت متوجه شد که مردم اهمیت زیادی به داشتن هوش مصنوعی‌ای می‌دهند که به آزادی، انصاف و برابری احترام بگذارد و خروجی‌هایی عاری از اطلاعات نادرست یا نظریه‌های توطئه ارائه دهد. این‌ها ایده‌هایی بودند که پیش‌تر در قانون اساسی Claude گنجانده شده بود. اما Anthropic دریافت که عموم مردم بیشتر علاقه دارند رفتار خاصی از سیستم هوش مصنوعی ترویج شود، یعنی به آن بگویند چه کاری باید انجام دهد، تا اینکه صرفاً از تولید خروجی‌های خاصی منع شود. مردم به بی‌طرفی و عینیت اهمیت بیشتری می‌دادند و بیشتر از کارکنان Anthropic خواهان دسترسی‌پذیری این فناوری برای افراد دارای معلولیت بودند.

آن‌ها همچنین دریافتند که نظرات عمومی درباره یک قانون اساسی هوش مصنوعی بر اساس خطوط حزبی[17] تقسیم شده است. حدود یک‌سوم افراد با ایده‌هایی که دو‌سوم دیگر تأیید کرده بودند، شدیداً مخالفت داشتند. اقلیت‌ها، برای مثال، حقوق فردی را بر منافع جمعی ترجیح می‌دادند. آن‌ها همچنین با استفاده از هوش مصنوعی برای رفع بی‌عدالتی‌های تاریخی یا اولویت دادن به نیازهای جوامع به‌حاشیه‌رانده‌شده مخالف بودند.

این یافته‌ها، با توجه به قطب‌بندی سیاسی در آمریکا، شگفت‌آور نیستند، اما نشان می‌دهند که یافتن اجماع برای یک قانون اساسی برای تنظیم رفتار ASI چقدر دشوار خواهد بود.

برخی فناوران پیشنهاد داده‌اند که مدل‌های هوش مصنوعی مختلفی با مجموعه‌ای متنوع از ارزش‌ها و ایدئولوژی‌های سیاسی ایجاد کنیم تا مصرف‌کنندگان بتوانند از میان آن‌ها انتخاب کنند. حتی عده‌ای پیشنهاد کرده‌اند که هر یک از ما به یک هوش مصنوعی شخصی نیاز خواهیم داشت که مطابق با ارزش‌ها و اصول خودمان طراحی شده باشد.

این ممکن است برای موج فعلی ایجنت‌های هوش مصنوعی مناسب باشد، اما اگر صحبت از ابرهوش مصنوعی باشد، به اقدامات ایمنی مشترکی برای رفتار همه سیستم‌های ASI نیاز خواهیم داشت. به‌عنوان مثال، نمی‌خواهیم این ماشین‌ها مردم را بکشند، به آن‌ها آسیب برسانند یا مرتکب تقلب شوند. قانون اساسی‌ای که این اصول اساسی را مشخص کند، نقطه شروع خوبی برای جلوگیری از خطرات موجودیتی خواهد بود.

یکپارچگی در نیات و تصمیمات

قانون‌‌های اساسی‌ می‌توانند ایمنی نسبی فراهم کنند، اما همواره قابل تفسیر هستند. بنابراین، به روشی نیاز داریم که اطمینان حاصل کنیم تفسیر یک هوش مصنوعی از اهداف ما با تفسیر خودمان مطابقت دارد. در حال حاضر، سیستم‌های هوش مصنوعی اغلب اهداف را به‌اشتباه تفسیر می‌کنند. این نرم‌افزارها در شناسایی همبستگی‌ها در طول آموزش بسیار ماهر هستند، اما این همبستگی‌ها ممکن است ارتباطی با آنچه که واقعاً می‌خواهیم به آن‌ها آموزش دهیم نداشته باشند.

به‌عنوان مثال، CoinRun یک بازی ویدئویی ساده است که OpenAI برای محیط آموزش ایجنت‌های هوش مصنوعی توسعه داده است. هدف این ایجنت این است که درون یک هزارتو حرکت کند، از موانع عبور کند، از هیولاها دوری کند، و در نهایت یک سکه پیدا کند تا به سطح بعدی برود. اما در طراحی اولیه این بازی، ایجنت همیشه از گوشه بالای سمت چپ صفحه شروع می‌کرد و سکه همیشه در سمت پایین راست قرار داشت که همان جایی است که ایجنت برای رفتن به سطح بعدی از آن خارج می‌شد. بنابراین، به‌جای اینکه ایجنت یاد بگیرد هدف بازی پیدا کردن سکه است، بیشتر ایجنت‌های هوش مصنوعی یاد گرفتند که همیشه به سمت راست بروند.

پژوهشگران دیگر اشاره کردند که این نقص درواقع CoinRun را به آزمایش خوبی تبدیل کرد برای اینکه ببینیم آیا می‌توانیم سیستم‌های هوش مصنوعی‌ای بسازیم که بتوانند هدف واقعی بازی (پیدا کردن سکه) را از هدف مرتبط اما اشتباه (همیشه به راست رفتن) تشخیص دهند یا خیر.

شرکت Aligned AI، یک استارت‌آپ کوچک در آکسفورد انگلستان، روی راه‌حل‌هایی برای این مشکل کار کرده است. این شرکت هوش مصنوعی‌ای ایجاد کرده که بهتر می‌تواند نیات انسانی را تشخیص دهد. نرم‌افزار این شرکت، که آن را الگوریتم استخراج مفاهیم[18] می‌نامد، اولین سیستمی بود که چالش هم‌راستایی CoinRun را حل کرد و یاد گرفت که سکه را هدف قرار دهد، نه اینکه صرفاً به سمت راست برود. این سیستم با توجه به تفاوت‌های بین داده‌های آموزشی خود و داده‌هایی که پس از استقرار با آن‌ها روبه‌رو می‌شود کار می‌کند. سیستم سعی می‌کند یک هدف جایگزین برای آنچه در آموزش یاد گرفته فرض کند که ممکن است این تفاوت‌ها را توضیح دهد. سپس مطابق میانگینی از آنچه اهداف قدیمی و جدید ایجاب می‌کنند عمل می‌کند. این فرآیند را تکرار می‌کند تا فرضیه‌اش به هدف واقعی نزدیک شود.

Aligned AI همچنین نشان داده است که می‌تواند این فرآیند را با درخواست یک انتخاب از انسان میان هدف اولیه آموزش‌داده‌شده و هدف فرض‌شده جدید کوتاه‌تر کند. با این نشانه انسانی، نرم‌افزار Aligned AI درک می‌کند که هدف واقعی‌اش باید چه باشد.

این تکنیک می‌تواند برای ایجاد هوش مصنوعی ابرهوشمند ایمن‌تر مفید باشد. اما در همین حال، می‌تواند به حل برخی از مشکلات هوش مصنوعی‌های کنونی نیز کمک کند. در یک آزمون مهارت‌های مدیریت محتوا، نرم‌افزار Aligned AI توانست ۹۷ درصد از اظهارات سمی یا توهین‌آمیز را شناسایی کند، درحالی‌که ChatGPT شرکت OpenAI فقط حدود ۳۲ درصد را تشخیص داد. در یک مجموعه داده ارزیابی دیگر که خود OpenAI آن را ایجاد کرده بود، نرم‌افزار Aligned AI موفق شد ۹۳ درصد از پاسخ‌های سمی را فیلتر کند، در مقایسه با ۷۹ درصد برای نرم‌افزار ویژه مدیریت محتوای خود OpenAI.

بزرگ‌تر، بهتر، ایمن‌تر؟

یکی از عجیب‌ترین جنبه‌های توسعه هوش مصنوعی این است که برخی از دانشمندانی که بیشترین نگرانی را درباره خطرات موجودیتی دارند، همان کسانی هستند که سخت‌تر از بقیه در تلاشند تا AGI و ASI را بسازند. داریو آمودی، یکی از بنیان‌گذاران و مدیرعامل Anthropic، این موضع به‌ظاهر متناقض را این‌گونه توجیه می‌کند: «برای ساختن چیز ایمن، باید ۹۰ درصد چیز خطرناک را بسازید. مشکل و راه‌حل واقعاً مثل مارهایی به‌هم‌پیچیده در هم تنیده هستند.» او استدلال می‌کند که مدل‌های بزرگ‌تر و توانمندتر هوش مصنوعی به‌طور ذاتی ایمن‌تر خواهند بود، زیرا می‌توانند بازنمایی‌های مفهومی بسیار قوی‌تر و شبیه‌تر به انسان ایجاد کنند. این به این معناست که تکنیک‌هایی مانند هوش مصنوعی قانون‌مند برای مدل‌های قدرتمندتر نسبت به مدل‌های کوچک‌تر مؤثرتر خواهند بود.

سم آلتمن از OpenAI و دمیس هاسابیس از DeepMind نیز این ترکیب عجیب از ترس و اشتیاق نسبت به ASI را به نمایش می‌گذارند. شنیدن صحبت‌های آن‌ها یادآور توضیح جی. رابرت اوپنهایمر[19] درباره دلیل ساخت بمب اتم است: «وقتی چیزی از نظر فنی جذاب به نظر برسد، شما جلو می‌روید و آن را می‌سازید و فقط پس از موفقیت فنی‌تان درباره اینکه با آن چه کنید بحث می‌کنید.» اما در مورد هوش مصنوعی، ما در حالی درباره اینکه با آن چه کنیم بحث می‌کنیم که هنوز در حال کار بر روی رسیدن به موفقیت فنی هستیم. شاید این نوعی پیشرفت باشد، اما این وضعیت همچنین دلیل آن است که نباید ایمنی هوش مصنوعی را صرفاً به دانشمندان و شرکت‌هایی که در تلاش برای ساخت ASI هستند، واگذار کنیم.

انسان‌ها می‌توانند تحت تأثیر غرور یا طمع کور شوند و شرکت‌هایی که برای آن‌ها کار می‌کنند تحت فشار سودآوری قرار دارند، که همین امر تصمیم‌گیری‌های پرریسک را توجیه‌پذیر می‌کند. برخی از شرکت‌هایی که در حال ساخت هوش مصنوعی پیشرفته هستند، ساختارهای حکمرانی پیچیده‌ای ایجاد کرده‌اند که برای اطمینان از اولویت ایمنی بر سود طراحی شده‌اند.

اما ضعف این نوع ساختارهای حکمرانی شرکتی و غیرانتفاعی در مهار خطرات موجودیتی در نوامبر ۲۰۲۳ آشکار شد، زمانی که هیئت مدیره OpenAI به‌طور موقت سم آلتمن را اخراج کرد. هیئت مدیره اعلام کرد که آلتمن همواره صادق نبوده و اعتماد آن‌ها را از دست داده است. اما پس از شورش کارکنان، که تهدید به استعفای دسته‌جمعی کردند، هیئت مدیره به توافقی رسید که طی آن آلتمن به‌عنوان مدیرعامل بازگردانده شد. سه عضو هیئت مدیره که در اخراج او دخیل بودند استعفا دادند و هیئت مدیره با اضافه کردن افرادی با تجربه در هیئت‌های مدیره شرکتی و غیرانتفاعی اما بدون سابقه در زمینه بررسی پیامدهای AGI و ASI گسترش یافت.

همچنین شریک تجاری نزدیک OpenAI، مایکروسافت، یک کرسی ناظر در هیئت مدیره به دست آورد. بررسی یک شرکت حقوقی که هیئت مدیره جدید آن را استخدام کرده بود نشان داد که اخراج آلتمن به هیچ نگرانی خاصی در زمینه ایمنی هوش مصنوعی یا تخلف مرتبط نبوده است. این موضوع، طبق گزارش شرکت حقوقی، صرفاً ناشی از یک شکست در اعتماد بود. اما همان‌طور که هلن تونر[20] و تاشا مک‌کالی[21]، دو عضو هیئت مدیره‌ای که استعفا دادند، در بیانیه‌ای که در شبکه‌های اجتماعی منتشر کردند، گفتند: «پاسخ‌گویی هنگام ساخت فناوری‌ای که پتانسیل تغییر جهان مانند AGI را دارد، حیاتی است؛ فریبکاری، دست‌کاری و مقاومت در برابر نظارت دقیق نباید قابل‌قبول باشد.»

نکته اینجاست که نباید مجبور باشیم صرفاً به هیئت مدیره OpenAI برای اطمینان از اینکه این شرکت کاری انجام نمی‌دهد که ممکن است جان همه ما را به خطر بیندازد، اعتماد کنیم. به نظارت دولتی نیاز است.

مکانی برای ایمنی بیشتر

ما به‌شدت نیازمند اقدام دولت‌ها در زمینه ایمنی هوش مصنوعی و خطرات موجودیتی هستیم. خبر خوب این است که الگویی داریم که در صنعتی دیگر (انرژی هسته‌ای) کارآمد بوده و ترس‌هایی مشابه درباره وقوع فاجعه را برمی‌انگیزد. صنعت هسته‌ای دارای استانداردها و ناظری است که اختیار دارد بازرس‌هایی را به درون نیروگاه‌های هسته‌ای بفرستد. قوانین و آژانس‌های ملی این صنعت نیز با یک آژانس بین‌المللی تقویت می‌شوند: آژانس بین‌المللی انرژی اتمی (IAEA).

ما باید ساختارهای حکمرانی مشابهی داشته باشیم که شفاف، پاسخ‌گو و برای ایمنی هوش مصنوعی طراحی شده باشند. این ساختارها باید از حمایت قانون و توافق‌نامه‌های بین‌المللی برخوردار باشند و شامل بازرسی و توانایی الزام به تبعیت شوند.

دولت ایالات متحده چند گام در این جهت برداشته است، اما تا کنون این اقدامات کافی نبوده‌اند. دولت بایدن موفق شد چند شرکت پیشرو در زمینه هوش مصنوعی را متقاعد کند که به مجموعه‌ای داوطلبانه از استانداردهای ایمنی هوش مصنوعی پایبند باشند و ارزیابی‌های مستقل امنیت سایبری روی مدل‌های قدرتمند هوش مصنوعی خود را بپذیرند. کاخ سفید همچنین این شرکت‌ها را موظف کرد نتایج آزمایش‌های داخلی ایمنی را با دولت به اشتراک بگذارند. یک مؤسسه جدید به نام AI Safety Institute نیز تأسیس شده تا استانداردهایی تدوین کند که شرکت‌ها باید از آن‌ها پیروی کنند.

اما مشکل اینجاست که دولت به‌طور مداوم ارزیابی‌های ایمنی مربوط به خطرات موجودیتی را انجام نمی‌دهد و هیچ سازوکاری برای اطمینان از اجرای درست استانداردها توسط شرکت‌های فناوری وجود ندارد. در حال حاضر، ما عمدتاً به ادعای شرکت‌ها اعتماد می‌کنیم که می‌گویند تمام تلاش خود را می‌کنند تا هوش مصنوعی جان همه ما را به خطر نیندازد، در حالی که این شرکت‌ها در رقابتی شدید برای ساخت AGI و ASI هستند.

قانون هوش مصنوعی اتحادیه اروپا که در دسامبر ۲۰۲۳ نهایی شد، از شرکت‌هایی که مدل‌های هوش مصنوعی قدرتمند و چندمنظوره می‌سازند می‌خواهد اطلاعات کلیدی درباره نحوه ساخت این نرم‌افزار، قابلیت‌ها و خطرات آن را افشا کنند. اما این فرآیند همچنان به‌شدت به خوداظهاری و خودگواهی شرکت‌ها متکی است. دولت‌ها تنها زمانی می‌توانند جریمه‌هایی اعمال کنند که مشکلی پیش آمده باشد. اما در مورد خطرات موجودیتی، اقدام پس از وقوع نمی‌تواند از فاجعه جلوگیری کند.

دولت‌ها باید توانایی مداخله قبل از استقرار یک سیستم هوش مصنوعی را داشته باشند، شاید حتی از آموزش یک سیستم ASI به‌طور کامل جلوگیری کنند. قانون هوش مصنوعی اتحادیه اروپا همچنین مدل‌های هوش مصنوعی متن‌باز را از الزامات سخت‌گیرانه‌تر خود معاف کرده است. این نیز رویکردی ناایمن است. طرفداران متن‌باز استدلال می‌کنند که دولت‌های مجوزدهنده باعث نابودی هوش مصنوعی متن‌باز، آسیب به نوآوری و به نوعی «تسخیر مقررات» توسط شرکت‌های بزرگ فناوری که روی مدل‌های بسته و اختصاصی کار می‌کنند، خواهد شد.

اما ما در صنایع هوانوردی و انرژی هسته‌ای نیز به مجوز و گواهی‌نامه نیاز داریم، بدون آنکه نگرانی‌ها درباره «نوآوری» بر ملاحظات اولیه ایمنی غلبه کند. مؤسسه جدید ایمنی هوش مصنوعی در ایالات متحده باید اختیاراتی برای نه‌تنها تعیین استانداردها، بلکه برای اجرای آن‌ها از طریق صدور مجوز، گواهی‌نامه و بازرسی داشته باشد. ما باید بدانیم که در دیتاسنترهای عظیم در دشت‌های آیووا و بیابان‌های آریزونا چه هیولاهای خطرناکی در حال زاده شدن هستند.

دولت می‌تواند استفاده صنعت‌محور از روش‌هایی مانند هوش مصنوعی قانون‌مند Anthropic یا تکنیک‌های تشخیص نیت که توسط Aligned AI در حال توسعه هستند را الزامی کند. و در حالی که دولت در حال حاضر فاقد تخصص کافی برای انجام نقش خود در ایمنی هوش مصنوعی است، باید به‌سرعت این ظرفیت را ایجاد کند.

خبر خوب این است که هنوز زمان داریم؛ ASI و AGI فناوری‌های قریب‌الوقوع نیستند. اما عاقلانه است که طوری عمل کنیم انگار هستند. این تنها راهی است که می‌توان مطمئن شد هرگونه پیشرفت غیرمنتظره، کل جهان را در معرض خطر قرار نمی‌دهد. در همین حال، همین پروتکل‌های ایمنی معقول می‌توانند کمک کنند نرم‌افزارهای هوش مصنوعی امروزی کمتر مضر و پرخطر باشند.

اقدامات در سطح ملی باید با گام‌های بین‌المللی همراه شوند. در این زمینه نیز گام‌هایی برداشته شده است، اما هنوز ناکافی‌اند. در نخستین اجلاس بین‌المللی ایمنی هوش مصنوعی که در سال ۲۰۲۳ در بلچلی[22] پارک انگلستان برگزار شد (مکانی که به خاطر ارتباطش با آلن تورینگ و رمزگشایی در جنگ جهانی دوم انتخاب شده بود)، نمایندگان ایالات متحده، چین و بیست‌وشش کشور دیگر، به‌همراه اتحادیه اروپا، توافق کردند که ایمنی باید در توسعه هوش مصنوعی در اولویت قرار گیرد و متعهد شدند برای دستیابی به درک مشترکی از خطرات هوش مصنوعی همکاری کنند.

هجده کشور از این جمع همچنین دستورالعمل‌های غیرالزام‌آوری را امضا کردند که بر توسعه هوش مصنوعی «طراحی ایمن[23]» تأکید داشتند. این سیاست‌ها معقول به نظر می‌رسند، اما مشخص نیست که آیا می‌توانند خطرات موجودیتی هوش مصنوعی را برطرف کنند یا خیر.

آنچه به آن نیاز داریم، یک توافق بین‌المللی الزام‌آور قانونی درباره ایمنی ASI و یک آژانس بین‌المللی برای تکمیل نقش نهادهای ملی است. آژانس بین‌المللی انرژی اتمی مدل مناسبی ارائه می‌دهد برای اینکه آژانس هوش مصنوعی چگونه می‌تواند عمل کند. IAEA این قدرت را دارد که از تأسیسات و مواد هسته‌ای در سراسر جهان بازرسی کند و یک نهاد بین‌المللی هوش مصنوعی نیز باید اختیارات مشابهی داشته باشد.

مهم‌تر از همه، همان‌طور که در فصل ۱۲ مورد بحث قرار گرفته است، قدرت‌های بزرگ جهان منافع قابل‌توجهی در پیشبرد ASI برای به دست آوردن مزیت‌های ژئوپلیتیکی یا نظامی دارند و این ممکن است منجر به کم‌توجهی به ایمنی شود. به همین دلیل، یک نهاد با قدرت بازرسی و نظارت فعال، مشابه با IAEA، ضروری است. تنها چنین نهادی می‌تواند امیدی به نظارت بر سیستم‌های هوش مصنوعی غیرنظامی و نظامی داشته باشد و دولت‌ها را پاسخ‌گو کند.

اگر هوش مصنوعی همه بشریت را تهدید می‌کند، نیاز به یک واکنش جهانی داریم. خطر موجودیتی هوش مصنوعی کوچک است اما واقعی. با توجه به پیامدهای وجودی اشتباه در این زمینه (کشته شدن یا به بردگی گرفتن میلیاردها نفر) باید عاقلانه و سریع عمل کنیم.

[1] Irving J. Good

[2] Vernor Vinge

[3] Technological Singularity

[4] سینه‌سرخ آمریکایی (American Robin): نوعی پرنده آوازخوان بومی آمریکای شمالی که به دلیل سینه نارنجی‌رنگش مشهور است.

[5] Ray Kurzweil

[6] Shane Legg

[7] Dario Amodei

[8] Nicholas Bostrom

[9] Alignment Problem

[10] Ilya Sutskever

[11] Isaac Asimov

[12] Immanuel Kant

[13] John Rawls

[14] Voltaire: François-Marie Arouet

[15] مراجعه شود به ابتدای فصل سیزدهم – (پاداش‌هایی که به خطا می‌روند)

[16] فرآیندی مانند روت کردن گوشی که به کاربران اجازه می‌دهد تا به برخی از قابلیت‌هایی که شرکت سازنده کار با آن‌ها را محدود کرده، دسترسی پیدا کنند.

[17] اختلاف‌نظرها و شکاف‌های ایدئولوژیک بین گروه‌های مختلف سیاسی یا اجتماعی، که بر مواضع و تصمیم‌گیری‌های آن‌ها تأثیر می‌گذارد.

[18] Algorithm for Concept Extraction

[19] J. Robert Oppenheimer

[20] Helen Toner

[21] Tasha McCauley

[22] Bletchley

[23] Safe by Design

نوشته‌ای ازmobin_khayati

درباره فناوری، هوش مصنوعی، کسب‌وکار و کیفیت تصمیم‌گیری.

یادداشت بعدی برای خواندن