کتاب تسلط بر هوش مصنوعی

تسلط بر هوش مصنوعی: فصل هشتم

تاریخ انتشار زمان مطالعه46 دقیقه نویسندهmobin_khayati
تسلط بر هوش مصنوعی
۱۴۰۵.۰۶.۲۰
بازگشت به یادداشت‌ها

فصل هشتم: هنر و حیله‌گری

برای بخش عمده‌ای از تاریخ بشر، خلق هنر مستلزم ترکیبی از توانایی‌های ذهنی و جسمی متنوع بود؛ نه تنها هوش شناختی، بلکه درکی تیزبین، هوش عاطفی و در بسیاری موارد، هوش حرکتی مشابه با ستاره‌های ورزشی. یک خواننده باید صدای خود را تمرین می‌داد تا نت‌ها را به‌درستی اجرا کند. یک نوازنده نیاز داشت حافظه‌ی عضلانی‌اش را تقویت کند تا سیم‌ها را با دقت به صدا درآورد. یک نقاش باید توانایی طراحی دقیق و کنترل قلم‌مو را در خود پرورش می‌داد. این روند در قرن نوزدهم، تا حد زیادی به دلیل اختراع عکاسی، تغییر کرد. همان‌طور که والتر بنیامین[1] فیلسوف اشاره کرده است: «برای اولین بار در فرآیند بازتولید تصویری، عکاسی دست انسان را از مهم‌ترین وظایف هنری رها کرد، وظایفی که از آن پس تنها به چشمِ خیره به لنز محول شد.»

در دهه‌های اخیر، نرم‌افزارهای مدرن توانسته‌اند رشته‌های درهم‌تنیده‌ی مهارت‌های انسانی در خلق هنر را تا حد زیادی تفکیک کنند؛ به‌گونه‌ای که کامپیوترها اکنون قادرند برخی از جنبه‌های هنرآفرینی را بر عهده بگیرند؛ از GarageBand اپل گرفته تا Photoshop ادوبی. با این حال، هنرمندان و موسیقی‌دانان آموزش‌دیده همچنان می‌توانند با این ابزارهای پیشرفته، آثاری خلق کنند که برای یک مبتدی دست‌نیافتنی است. دیوید هاکنی[2]، مثلاً، با یک آی‌پد کارهایی انجام می‌دهد که من و شما هرگز قادر به انجامش نیستیم. حتی نخستین نسل از ویدیوهای جعلی عمیق (Deepfake) ساخته‌شده توسط هوش مصنوعی نیز به تخصص فنی و مهارت‌های حرفه‌ای در مراحل پس‌تولید نیاز داشت.

اما مدل‌های مولد هوش مصنوعی امروزی فراتر از این رفته‌اند و ایده را به‌طور بنیادین از اجرا جدا کرده‌اند. عکاسی همچنان به مهارت‌هایی فراتر از تخیل نیازمند است. یک عکاس ماهر باید بتواند یک تصویر را قاب‌بندی کند، از تکنیک‌های فنی برای تنظیم نور و عمق میدان بهره ببرد و حس زمان‌بندی بی‌نقصی داشته باشد. اما هوش مصنوعی مولد به هیچ‌یک از این‌ها نیاز ندارد. آنچه اهمیت دارد، تنها چشم ذهن است.

بیش از هر فناوری پیشین، هوش مصنوعی مولد برتری ایده را در زنجیره ارزش آفرینش تثبیت کرده است و همان‌طور که درباره بسیاری از جنبه‌های هوش مصنوعی صادق است، گستره و وسعت این فناوری است که آن را شگفت‌انگیز می‌کند. هیچ شکلی از هنر از دسترس آن دور نخواهد ماند. ابزارهای متن‌به‌تصویر قادرند انواع تصاویر، از کارتون‌های ساده گرفته تا آثار امپرسیونیستی[3] یا واقعیات فوتورئالیستی[4] را تنها با یک دستور خلق کنند. MusicLM گوگل، Stable Audio از Stability AI، و Jukebox از OpenAI ابزارهایی هستند که همین کار را برای موسیقی انجام می‌دهند. نرم‌افزار Gen-2 از Runway ویدیوهای کاملی را بر اساس دستورات متنی تولید می‌کند. مدل‌های زبانی بزرگ همچون GPT-4 از OpenAI و Claude از Anthropic می‌توانند داستان‌های کوتاه و شعر بنویسند.

این ابزارها تولیدات فرهنگی و سرگرمی را به شکلی بنیادین متحول خواهند کرد. اما همان‌طور که در بسیاری از حوزه‌های هوش مصنوعی دیده‌ایم، این تحول پیامدهایی متناقض به همراه دارد: تولید محتوای هنری و سرگرمی به‌طرز چشمگیری افزایش خواهد یافت و امکان استفاده از ابزارهای بیان هنری به افراد بیشتری داده خواهد شد. با این حال، این دموکراتیزه‌سازیِ[5] تولید هنری احتمالاً قدرت بیشتری را به دست کسانی می‌دهد که ابزارهای گزینش، توزیع و بازاریابی محتوا را کنترل می‌کنند. در چنین شرایطی، یافتن آثار ارزشمند در میان سیل انبوه محتوا دشوارتر از همیشه خواهد شد.

هوش مصنوعی همچنین پرسش‌های عمیقی درباره ماهیت خلاقیت ایجاد می‌کند. همان‌طور که خواهیم دید، هوش مصنوعی مولد امروزی نخستین نرم‌افزاری است که می‌تواند برخی از جنبه‌های خلاقیت انسانی را بازتولید کند، اما هنوز قادر نیست با تمامی ابعاد خلاقیت انسانی برابری کند. در عرصه‌ی هنر، همچون بسیاری دیگر از حوزه‌ها، هوش مصنوعی همکار ما خواهد بود، نه جایگزین ما. هنرمندان و نبوغ انسانی همچنان حیاتی و ممتاز باقی خواهند ماند. هوش مصنوعی ارزش هنرهایی که جنبه‌های فیزیکی دارند (مانند مجسمه‌سازی، سرامیک‌سازی، شیشه‌گری، معماری، تئاتر و اجراهای زنده) را افزایش خواهد داد، زیرا بازتولید این هنرها برای هوش مصنوعی به‌سادگی ممکن نیست. به همین دلیل، هوش مصنوعی احتمالاً قدردانی ما از هنرهای آوانگارد[6] را نیز گسترش خواهد داد. یگانگی چنین آثاری بازتولیدشان را برای هوش مصنوعی به‌جز در موارد تصادفی دشوار می‌سازد. هرچند، برخی نویسندگان و هنرمندان بصری، همین حالا از هوش مصنوعی به عنوان بخشی از فرآیند خلق آثار چالش‌برانگیز و برهم‌زننده‌ی مرزها استفاده می‌کنند.

در تاریخ، لحظات تحولات عمیق فناوری و اجتماعی اغلب موجب ظهور رنسانس‌های[7] هنری شده‌اند. شاید هوش مصنوعی مخرب‌ترین فناوری ما تا به امروز باشد. اکنون باید مشتاقانه ببینیم که هنرمندان انسانی در پاسخ به این دگرگونی، چه خواهند آفرید.

معادله آلتمن

در اواخر سال ۲۰۲۳، سم آلتمن، مدیرعامل OpenAI، در پستی در ایکس (پلتفرمی که پیش‌تر با نام توییتر شناخته می‌شد) نوشت: «هر چیز “خلاقانه” چیزی نیست جز بازترکیب چیزهایی که در گذشته اتفاق افتاده‌اند، به اضافه یک اپسیلون، ضرب در کیفیت بازخورد و تعداد تکرارها. مردم فکر می‌کنند که باید اپسیلون را به حداکثر برسانند، اما کلید موفقیت در به حداکثر رساندن دو عامل دیگر است.» بسیاری از هنرمندان، فیلسوفان و منتقدان فرهنگ تک برو[8] سیلیکون‌ولی، به‌درستی آلتمن را به دلیل این رویکرد شبه‌ریاضی انتقاد کردند. اما فرضیه اصلی او، اینکه خلاقیت بیشتر از آنکه به جرقه‌ای نوآورانه (همان اپسیلون در فرمول آلتمن) وابسته باشد، به بازترکیب ایده‌های پیشین مرتبط است؛ خود ایده‌ای نو نیست و آلتمن نیز این موضوع را پذیرفته است. بسیاری از متخصصان خلاقیت نیز این دیدگاه را تأیید می‌کنند.

دیوید ایگلمن[9]، عصب‌شناس دانشگاه استنفورد، که همراه با آهنگساز آنتونی برنت[10] کتابی درباره خلاقیت انسانی[11] نوشته است، معتقد است که تمام خلاقیت را می‌توان به سه عمل اصلی که بر روی آثار نسل‌های گذشته انجام می‌شود، تقلیل داد: خم کردن، ترکیب کردن، یا شکستن. او و برنت همچنین استدلال می‌کنند که مغز تنها می‌تواند آنچه را که از پیش می‌داند، تغییر دهد. اختراعات از هیچ به وجود نمی‌آیند. «خلاقیت، همانند الماس، نتیجه فشرده‌سازی تاریخ به اشکال نوین و درخشان است»، ایگلمن و برنت می‌نویسند. یا به گفته رمان‌نویس مشهور، مایکل شابون[12]، که در مستند مغز خلاق[13] (مبتنی بر کارهای ایگلمن و برنت) به‌طور صریح‌تری بیان می‌کند: «اصالت، مزخرف است.»

اینکه آیا این اظهارنظر شابون دقیق است یا نه، موضوعی قابل بحث است، اما روشن است که هوش مصنوعی نمی‌تواند به خوبی انسان‌ها خم کند، ترکیب کند و بشکند. بیشتر هوش مصنوعی‌های مولد با داده‌های تاریخی آموزش می‌بینند و سپس مدل هوش مصنوعی با استفاده از این داده‌ها به نوعی میان‌یابی (Interpolation) بین نقاط داده‌ای در مجموعه آموزشی خود دست می‌زند و عناصر مختلفی از هرکدام را با هم ترکیب می‌کند. در ریاضیات، میان‌یابی به معنای افزودن نقاط جدید به نموداری است که بین نقاط موجود قرار می‌گیرند. اگر یک کتاب رنگ‌آمیزی کودکانه را در نظر بگیرید، میان‌یابی شبیه به وصل کردن نقاط و رنگ‌آمیزی شکل‌هایی است که از خطوط ایجاد شده تشکیل می‌شوند.

در دسته‌بندی خلاقیت ایگلمن و برنت، این نوع میان‌یابی عمدتاً به خم کردن و ترکیب کردن مرتبط است. به‌عنوان مثال، هوش مصنوعی در انتقال سبک‌های بصری بسیار مهارت دارد: مثلاً یک عکس از خیابانی در نیویورک را بگیرید، اما آن را با رنگ‌ها و سبک چرخشی نقاشی شب پرستاره ون‌گوگ[14] بازآفرینی کنید. یا تصویر صورت خود را به یک شخصیت انیمه ژاپنی یا یک شخصیت ترسناک فیلم‌های گوتیک تبدیل کنید. چنین قابلیت‌هایی الهام‌بخش هزاران اپلیکیشن تلفن هوشمند شده است.

امروزه هوش مصنوعی در برخی از جنبه‌های آنچه ایگلمن و برنت ترکیب کردن می‌نامند نیز عملکرد مناسبی دارد. به‌عنوان مثال، بازسازی هوشمندانه نورمن راکول[15] از حالت و ژست پیامبر اشعیا[16] در نقاشی سقف کلیسای سیستین[17] اثر میکل‌آنژ[18]، که در تصویر او از روزیِ ریوتر (Rosie the Riveter) به کار رفته است، نمونه‌ای از ترکیب کردن است که هوش مصنوعی مولد نیز می‌تواند، البته با دستور مناسب، آن را بازآفرینی کند. (البته الهام برای ترکیب دقیقاً همین تصاویر، همچنان باید از ذهن انسان سرچشمه بگیرد.)

مدل Gen1 از شرکت Runway، بر اساس همین ایده ساخته شده است و قادر است یک ویدیو را بگیرد و یکی از عناصر صحنه (مثل یک شخصیت، یک وسیله، یا پس‌زمینه) را با عناصر تولیدشده توسط هوش مصنوعی جایگزین کند. بازاستفاده از یک شیء، روش یا تکنیک نیز شکلی از ترکیب کردن است.

مدل‌های زبانی بزرگ (LLMs) نیز در آزمون‌های خلاقیتی که شامل پیشنهاد برای بازاستفاده از اشیاء هستند، امتیاز بالایی کسب می‌کنند. برای مثال، در آزمون کاربردهای جایگزین (AUT) که در سال ۱۹۶۷ توسط روان‌شناس جی. پی. گیلفورد[19] طراحی شد، وقتی پژوهشگران در سال ۲۰۲۳ چند مدل هوش مصنوعی را آزمایش کردند، دریافتند که آن‌ها به اندازه اکثر انسان‌ها خلاق هستند. تنها ۹ درصد از افراد در این آزمون بهتر از خلاق‌ترین مدل هوش مصنوعی، یعنی GPT-4 از OpenAI، عمل کردند. علاوه بر این، GPT-4 در آزمون جامع‌تر خلاقیت، یعنی آزمون تفکر خلاق تورنس (Torrance Tests of Creative Thinking)، نیز در صدک نودونهم قرار گرفت و عملکردی بهتر از اکثر انسان‌ها داشت.

شکستن قالب

اگرچه هوش مصنوعی می‌تواند تا حدی از عهده‌ی خم کردن و ترکیب کردن بربیاید، در زمینه‌ی شکستن با مشکل مواجه می‌شود. شکستن شامل جدا کردن یک یا چند بخش از یک کل منسجم است و اغلب به قرار دادن این قطعات شکسته در یک زمینه یا ترتیب جدید نیاز دارد. دیوید ایگلمن و آنتونی برنت، دستگاه ادبی مجاز مرسل (synecdoche) را نوعی شکستن به شمار می‌آورند، که در آن بخشی از یک شیء نماینده‌ی کل آن می‌شود (مثلاً «چرخ‌ها» به معنای ماشین‌ها یا «کت‌وشلوارها» به معنای تاجران). آن‌ها همچنین به شیوه‌ای اشاره می‌کنند که باخ[20] در فوگ ر ماژور از مجموعه‌ی کلاویه‌ی خوش‌آهنگ[21] تم اصلی خود را معرفی می‌کند، اما چهار نت آخر آن را می‌شکند و این نت‌ها را به‌عنوان موتیفی در باقی قطعه پراکنده می‌کند.

سیستم‌های هوش مصنوعی امروز به ندرت می‌توانند به این شیوه چیزها را بشکنند و تقریباً هیچ‌گاه بدون دستورالعمل انسانی گسترده قادر به انجام آن نیستند. دلیل این امر آن است که شکستن شامل برون‌یابی (Extrapolation) می‌شود، در حالی که مدل‌های مولد هوش مصنوعی کنونی در میان‌یابی (Interpolation) مهارت دارند. برون‌یابی به معنای پیش‌بینی داده‌هایی در نقطه‌ای دور از نمودارِ داده‌های آموزشی مدل است. به عبارت دیگر، برون‌یابی مانند رنگ‌آمیزی خارج از خطوط است. اگر یک مدل هوش مصنوعی هرگز نمونه‌ای از آنچه در دستورالعمل خواسته شده مشاهده نکرده باشد، معمولاً در تولید نتیجه‌ی مورد نظر شکست می‌خورد. علاوه بر این، برای شکستن چیزی به قطعات، ابتدا باید آن کل را درک کنید و این درک کل و اجزای تشکیل‌دهنده‌ی آن، که روان‌شناسان شناختی به آن ترکیب‌پذیری (Compositionality) می‌گویند، چیزی است که از هوش مصنوعی‌های مبتنی بر یادگیری عمیق کنونی فراتر است. برای مثال، ایگلمن و برنت به مجسمه‌ی هرم شکسته اثر بارنت نیومن[22] اشاره می‌کنند، که یک اُبلیسک فولادی را نشان می‌دهد که تقریباً از وسط افقی شکسته شده است و بخش بالایی آن وارونه، با نوک به سمت پایین، روی نوک یک هرم قرار گرفته است.

وقتی نویسنده‌ی مقاله تلاش کرد با استفاده از Midjourney تصویری شبیه به هرم شکسته ایجاد کند، حتی با ذکر نام نیومن و عنوان اثر در دستورالعمل، این هوش مصنوعی نتوانست اُبلیسکی وارونه یا افقی شکسته شده را به تصویر بکشد. DALL-E، هوش مصنوعی دیگری از OpenAI نیز در این زمینه ناکام ماند. دلیل این امر آن است که در داده‌های آموزشی این مدل‌ها به اندازه‌ی کافی تصویر از اُبلیسک‌های وارونه وجود ندارد. علاوه بر این، مدل‌ها درک نمی‌کنند اُبلیسک چیست و بنابراین نمی‌توانند تشخیص دهند کدام عناصر تصویر ضروری هستند. برای مثال، DALL-E قادر بود اُبلیسک را وارونه کند، اما در عین حال تمایل داشت زمین زیر اُبلیسک را هم وارونه کند و تصویری تولید می‌کرد که زمین هم در بالا و هم در پایین قرار داشت.

این ناتوانی در برخورد با ترکیب‌پذیری، محدودیت‌هایی برای کاربرد این مولدهای تصویری ایجاد می‌کند. برای مثال، DALL-E 3 نمی‌تواند تصویر یک نقاش مرد بدون ریش ایجاد کند، مهم نیست چند بار عبارت‌هایی مانند «اصلاح‌شده»، «بدون ریش» یا «بدون موی صورت» در دستورالعمل تکرار شود. در مدل ذهنی این هوش مصنوعی، ریش و سبیل از تصور آن از یک نقاش جدانشدنی هستند. به‌طور ساده، سیستم‌های مولد هوش مصنوعی برای شکستن سنت آموزش ندیده‌اند. در واقع، خروجی آن‌ها خودِ تعریفِ سنت است. این سیستم‌ها طوری آموزش دیده‌اند که نمونه‌هایی نزدیک به مد آماری یا مدهای داده‌ی آموزشی‌شان تولید کنند؛ یعنی نمونه‌هایی که در مجموعه‌ی آموزشی بیشترین تکرار را داشته‌اند. در مثالی تکان‌دهنده که در فصل یازدهم به آن اشاره خواهیم کرد، وقتی پژوهشگران از Midjourney خواستند تصویری از «یک پزشک سیاه‌پوست آفریقایی که به یک کودک سفیدپوست بیمار رسیدگی می‌کند» تولید کند، هوش مصنوعی در ۲۹۹ تلاش از ۳۰۰ تلاش خود تصویری از یک پزشک سفیدپوست در حال مراقبت از کودکان سیاه‌پوست تولید کرد. دلیل این امر آن بود که در داده‌های آموزشی این مدل، تصاویر پزشکان سیاه‌پوستی که به کودکان سفیدپوست رسیدگی می‌کنند بسیار کم بودند.

در همین حال، مدل‌های زبانی بزرگ (LLMs) طوری آموزش دیده‌اند که محتمل‌ترین کلمه‌ی بعدی در یک جمله را پیدا کنند. اما نوشتن خوب اغلب به یافتن غیرمنتظره‌ترین کلمه‌ای که همچنان معنای جمله را حفظ کند، وابسته است. این مدل‌ها قادر به انجام چنین کاری نیستند، چرا که هیچ درک روشنی از آنچه می‌گویند ندارند؛ فقط مجموعه‌ای از همبستگی‌ها در شبکه‌های عصبی‌شان نهفته است.

این موضوع توضیح می‌دهد که چرا حتی با درخواست‌هایی خاص مانند «از کلیشه‌ها استفاده نکن»، مدل‌های مولد همچنان دچار مشکل می‌شوند. آن‌ها نمی‌فهمند چه چیزی نباید انجام دهند. در ارزیابی‌ای که توانایی‌های نویسندگی خلاق هوش مصنوعی‌های مولد را زیر سؤال می‌برد، پژوهشگرانی از دانشگاه کلمبیا و شرکت Salesforce از کارشناسان ادبی خواستند داستان‌های کوتاهی که هوش مصنوعی‌ها با شروع داستان‌های منتشرشده در نیویورکر نوشته بودند را بدون اطلاع از نویسنده ارزیابی کنند. همه‌ی داستان‌های نوشته‌شده توسط هوش مصنوعی، به دلیل استفاده از استعاره‌های کلیشه‌ای، دیالوگ‌هایی بدون لایه‌های زیرمتنی و پایان‌های غیرجذاب، کم‌ارزش‌تر از نسخه‌های انسانی تلقی شدند.

البته انواع دیگری از هوش مصنوعی ممکن است از نظر تئوری بتوانند اصیل‌تر عمل کنند. احمد الجمال[23]، دانشمند مصری-آمریکایی و استاد دانشگاه راتگرز، نوعی نرم‌افزار هوش مصنوعی به نام شبکه‌ی متخاصم خلاق (Creative Adversarial Network یا CAN) طراحی کرده است. این نرم‌افزار از روشی مشابه با آنچه برای ایجاد دیپ‌فیک‌ها استفاده می‌شود، الهام گرفته است. برای ایجاد این نوع نرم‌افزار، نیاز به دو مدل شبکه عصبی است: یکی که تصاویر تولید می‌کند و دیگری که سعی می‌کند آن‌ها را طبقه‌بندی کند. در این مورد، الجمال شبکه‌ی طبقه‌بندی‌کننده را با مجموعه‌داده‌ی WikiArt آموزش داد تا ابتدا تشخیص دهد که آیا یک تصویر احتمالاً هنر است یا خیر و سپس سبک هنری آن را شناسایی کند. مولد یاد می‌گیرد چگونه تصاویری شبیه به هنر در سبک‌های مختلف ایجاد کند. اما الجمال همچنین یک عملکرد به نام ابهام سبک ایجاد کرد، که در آن مولد، تصویری تولید می‌کند که طبقه‌بندی‌کننده همچنان آن را هنر می‌داند، اما قادر به شناسایی دقیق سبک آن نیست. نتیجه، تصاویری بود که در استفاده از خطوط و رنگ کاملاً نوآورانه و انتزاعی بودند. الجمال گفت: «ماشین مسیر تاریخ هنر را ثبت کرده است، که به سمت انتزاع حرکت می‌کند.»

مشکل اینجاست که این ادعا تلویحاً بیان می‌کند تنها تصاویر انتزاعی می‌توانند واقعاً اصیل باشند. این ادعا که تمام هنر به سمت انتزاع گرایش دارد نیز نادرست به نظر می‌رسد. درست است که هنرهای زیبا طی ۱۵۰ سال گذشته از بازنمایی صرف فاصله گرفته‌اند. اما مقصد هنر تنها انتزاع نبوده است. شاید صحیح‌تر این باشد که بگوییم مقصد هنر، روشنفکری بوده است، جایی که ایده‌ی پشت اثر به اندازه، یا حتی بیشتر از، ویژگی‌های زیبایی‌شناختی آن اهمیت دارد.

راه دیگری برای تولید سیستمی خلاق‌تر، کنار گذاشتن داده‌های آموزشی تولیدشده توسط انسان است. DeepMind گوگل نوعی هوش مصنوعی به نام MuZero ایجاد کرد که به این شیوه عمل می‌کند. این سیستم می‌توانست شطرنج، چکرز، گو، یا هر بازی دو نفره‌ای را که هر دو بازیکن اطلاعات کامل از وضعیت بازی دارند، بازی کند. MuZero بدون هیچ دانش اولیه‌ی انسانی درباره‌ی بازی به سطحی فوق‌انسانی رسید. این سیستم باید همه چیز را از طریق آزمون و خطا، از جمله قوانین بازی، کشف می‌کرد.

در شطرنج، MuZero بسیاری از حرکت‌هایی که انسان‌ها طی ۱۵۰۰ سال از زمان اختراع بازی ایجاد کرده بودند را دوباره کشف کرد. اما سپس فراتر از آن‌ها رفت و استراتژی‌هایی ابداع کرد که پیش از آن دیده نشده بودند و سبکی از بازی را کامل کرد که بیشتر قوانین کلی را زیر پا می‌گذاشت. این خلاقیت بی‌چون و چرا تحولی بود. اما این امر تنها به این دلیل امکان‌پذیر شد که بازی‌ها سیگنال پاداش داخلی دارند که به سیستم هوش مصنوعی کمک می‌کند بفهمد آیا تاکتیک‌های مفید ابداع می‌کند یا خیر. همچنین محیط نسبتاً محدودی که در آن عمل می‌کند؛ یعنی مرزهای صفحه‌ی بازی و قوانین بازی.

در بسیاری از حوزه‌های هنری و خلاقانه، تعریف سیگنال پاداش بسیار دشوارتر است، در حالی که «فضای عمل» که هوش مصنوعی می‌تواند در آن عمل کند کل جهان هستی را در بر می‌گیرد. این موضوع استفاده از یادگیری تقویتی (Reinforcement learning) برای هنر را دشوار می‌کند. ما می‌توانیم، شاید، از مردم بخواهیم به تصاویر تولیدشده توسط هوش مصنوعی رأی دهند و این می‌تواند یک سیگنال پاداش فراهم کند. اما این چیزی نیست که هنرمندان بزرگ انسانی انجام ‌دهند. هنرمندان معمولاً برای هدایت کارشان به سیگنال پاداش خارجی وابسته نیستند و قطعاً به خرد جمعی اعتماد نمی‌کنند. ون‌گوگ در طول زندگی‌اش آثار نسبتاً کمی فروخت. رمان موبی دیک هرمان ملویل[24] در زمان حیات نویسنده فقط سه هزار نسخه فروش داشت. هنرمندان علیرغم رد شدن، به دلیل اعتقاد درونی خود ادامه می‌دهند، نه به دلیل پاداش خارجی.

اما آیا این هنر است؟

صبحی روشن اما خنک در پاییز، در یک سالن شلوغ در کریستیز نیویورک. همهمه‌ی جمعیت، که بی‌قرار روی صندلی‌هایشان جابه‌جا می‌شوند، صدای ورق زدن کاتالوگ‌ها، به سکوتی پرتنش فروکش می‌کند، وقتی حراج‌گذار به پشت تریبون می‌رود. کنار او، روی یک سه‌پایه، تصویری قرار گرفته که به نظر پرتره‌ای ناتمام از یک مرد است، با لباسی که به‌طور مبهم به اروپای قرن هفدهم شباهت دارد، اما به‌سختی می‌توان آن را دقیقاً تعیین کرد. تصویر به طرز عجیبی دفرمه شده است؛ سر مرد آن‌قدر بالای بوم قرار گرفته که بخشی از آن قطع شده و جزئیات چهره‌اش مبهم است. این تصویر در یک قاب طلایی کلاسیک نمایش داده شده است. تنها نشانه‌ای که مشخص می‌کند این اثر یک شاهکار هلندی کشف‌شده در یک بازار عتیقه‌فروشی نیست، امضای آن است: نه یک نام، بلکه یک الگوریتم ریاضی. این اثر با نام پرتره ادموند دو بلامی[25] نه یک نقاشی، بلکه یک چاپ روی بوم است که توسط گروه هنری پاریسی به اسم آبویس آرت[26] با استفاده از هوش مصنوعی خلق شده است. حراج‌گذار پیشنهاد را از ۷,۰۰۰ دلار آغاز می‌کند. پدال‌های زیادی بالا می‌روند. قیمت به‌سرعت افزایش می‌یابد: ۱۰,۰۰۰ دلار. سپس ۵۰,۰۰۰ دلار. ۱۰۰,۰۰۰ دلار و همچنان پیشنهادها ادامه دارد. فضا پر از هیجان می‌شود ۱۵۰,۰۰۰ دلار. ۱۷۵,۰۰۰ دلار. پیشنهادهای بیشتری از طریق وب‌سایت کریستیز و تلفن وارد می‌شوند. وقتی قیمت به ۲۰۰,۰۰۰ دلار می‌رسد، فقط یک نفر همچنان پدالش را بالا نگه داشته است، اما او با دو پیشنهاددهنده‌ی تلفنی و یک نفر آنلاین رقابت می‌کند. قیمت که از ۲۵۰,۰۰۰ دلار می‌گذرد، پدال مرد پایین می‌آید. اکنون تنها دو نفر باقی مانده‌اند، یکی آنلاین و دیگری تلفنی، هر دو از فرانسه. در قیمت ۳۵۰,۰۰۰ دلار، پیشنهاددهنده‌ی آنلاین از رقابت دست می‌کشد. ضربه! چکش حراج‌گذار فرود می‌آید، هفت دقیقه پس از آغاز. با احتساب هزینه‌ها، قیمت نهایی به ۴۳۲,۵۰۰ دلار می‌رسد. چهل‌وسه برابر برآورد اولیه‌ی اثر.

حراج ادموند دو بلامی در ۲۵ اکتبر ۲۰۱۸ موجی از واکنش‌ها را در میان منتقدان فرهنگی و تاریخ‌نگاران هنر برانگیخت، که آن را به معنای پایان هنر می‌دانستند. اما در چند سال، چنین صحنه‌هایی دیگر تیتر خبری نخواهند بود. نرم‌افزارهای آسان برای استفاده به‌سرعت در حال تبدیل کردن تصاویر تولیدشده توسط هوش مصنوعی به امری فراگیر هستند و این آثار به‌طور فزاینده‌ای در صفحات کاتالوگ‌های حراج‌های جهانی ظاهر خواهند شد. اما این موضوع پاسخ روشنی به این پرسش نمی‌دهد که آیا آنچه هوش مصنوعی تولید می‌کند، واقعاً هنر است یا خیر.

اگر هنر را در چشم بیننده (یا شاید بدبینانه‌تر، در چشم خریدار) بدانیم، پاسخ تقریباً قطعاً مثبت است. اساساً این همان معیاری است که در آزمون تورینگ استفاده می‌شود، اگر مخاطب نتواند بین خروجی هوش مصنوعی و اثری که توسط انسان خلق شده تمایز قائل شود، یا حتی اهمیتی به این تمایز ندهد، پس آن خروجی هنر است. همان‌طور که در فصل اول بررسی کردیم، در این ارزیابی، فرآیند کاملاً نادیده گرفته می‌شود. تنها تأثیر اهمیت دارد، نه علت.

هوش مصنوعی‌های تولید تصویر امروزی می‌توانند تصاویر زیبا و دل‌پذیری تولید کنند که اغلب از نظر ظاهری از آثار هنری انسانی قابل تمایز نیستند. این تصاویر، احتمالاً از منظر صرفاً زیبایی‌شناختی، تأثیری مشابه بر بیننده خواهند داشت. در واقع، این همان چیزی است که احمد الجمال کشف کرد، زمانی که از مردم، از جمله متخصصانی مانند تاریخ‌نگاران هنر و هنرمندان، خواست تا خروجی نرم‌افزار CAN خود را ارزیابی کنند. بیشتر آن‌ها آثار CAN را بدیع، زیباشناختی و غیرقابل تمایز از هنر انسانی یافتند. بنابراین، از نظر الجمال، این آثار هنر بودند. اما اگر دیدگاه مخالف را در نظر بگیریم، که آنچه چیزی را به هنر تبدیل می‌کند تنها نیت خالق است، آنگاه هر اثری که به‌طور کامل توسط هوش مصنوعی تولید شده باشد، اصلاً هنر نیست.

یک سیستم هوش مصنوعی نه نیتی دارد و نه تجربه‌ی زیسته‌ای. به‌ویژه، هیچ تجربه‌ی احساسی ندارد. از این دیدگاه، تأثیر بر مخاطب بی‌ربط است؛ تنها حس و نیت خالق اهمیت دارد. به گفته‌ی نیک کیو[27]، موزیسین استرالیایی، که در یک پست وبلاگی بحث‌برانگیز درباره‌ی غیرواقعی بودن ترانه‌های تولیدشده توسط مدل‌های زبانی بزرگ نوشت: «یک سیستم هوش مصنوعی ممکن است آهنگی بسازد که در ظاهر از یک اثر اصلی قابل تمایز نباشد، اما همیشه یک بازتولید است، نوعی تقلید مسخره‌آمیز. آهنگ‌ها از دل رنج بیرون می‌آیند و تا جایی که من می‌دانم، الگوریتم‌ها احساس ندارند. داده‌ها رنج نمی‌کشند. ChatGPT هیچ وجود درونی ندارد، هیچ‌کجا نبوده، چیزی را تحمل نکرده و جسارت عبور از محدودیت‌هایش را نداشته است؛ بنابراین، ظرفیت تجربه‌ی مشترک متعالی را ندارد، زیرا هیچ محدودیتی برای عبور کردن ندارد.»

در دیدگاه کیو، حتی اگر انسانی از یک مدل هوش مصنوعی به‌عنوان ابزار استفاده کند، باز هم نتیجه نمی‌تواند بیان هنری باشد، زیرا انسان از مدل هوش مصنوعی استفاده کرده است تا مسیر دشوار رنج کشیدن برای یافتن شیوه‌ی بیان یک ایده را دور بزند. (فرآیندی که او آن را جوهره‌ی هنر می‌داند.) اما تعریف کیو از هنر بیش از حد پیش می‌رود. اثر معروف چشمه، که معمولاً به مارسل دوشان[28] نسبت داده می‌شود (هرچند که اخیراً این انتساب مورد تردید قرار گرفته)، بدون شک هنر بود، حتی اگر دوشان یا هرکسی که اثر را به نمایشگاه انجمن هنرمندان مستقل آمریکا در سال ۱۹۱۷ ارسال کرد، هیچ زحمتی برای ساختن شیء نکشیده باشد. کار هنری، یا همان رنج در تعریف کیو، تماماً در ایده‌پردازی و تصمیم‌گیری‌ها بود؛ انتخاب اینکه از کدام آبریزگاه استفاده شود، تصمیم برای امضای آن با نام مستعار «R. Mutt, 1917» و ارسال آن به نمایشگاه؛ این تصمیم‌های انسانی است که آبریزگاه را از یک شیء پیش‌پاافتاده به هنر ارتقا می‌دهد. ادموند دو بلامی نیز مشابه این است؛ هنرمندان گروه آبویس مجبور بودند تصمیم بگیرند از کدام روش هوش مصنوعی استفاده کنند، چه تصاویری را به الگوریتم بدهند، کدام خروجی را انتخاب کنند و چگونه آن را نام‌گذاری و امضا کنند.

برخی هنرمندان از اینکه مردم نمی‌توانند بین یک تصویر تولیدشده توسط هوش مصنوعی و اثری که یک نقاش برای آن زحمت کشیده تمایز قائل شوند، یا بین یک آهنگ ساخته‌ی هوش مصنوعی و آهنگی که نیک کیو برای آن رنج کشیده است، دلسرد می‌شوند. علاوه بر این، آن‌ها از این ناامیدند که بسیاری از مردم اصلاً اهمیت نمی‌دهند. (آن‌ها فقط یک تصویر زیبا یا یک آهنگ جذاب می‌خواهند.) اما ما قبلاً نیز در این موقعیت بوده‌ایم و هنر همچنان پابرجا مانده است. والتر بنیامین، در نوشته‌های خود درباره‌ی تأثیر عکاسی و لیتوگرافی بر هنر بصری، استدلال کرد که سهولت تکثیر، «هاله»ی تصویر را کاهش می‌دهد. او هاله را به‌عنوان پیوند یکتای میان یک اثر هنری و عمل خلق آن، هدف از خلق آن، و مکانی که در آن به نمایش گذاشته می‌شود تعریف کرد، که همه‌ی این‌ها به تأثیر احساسی اثر کمک می‌کنند. اما در حالی که تکثیر، هاله‌ی نسخه‌ها را کاهش می‌دهد، می‌تواند هاله‌ی اثر اصلی را افزایش دهد. فقط با دیدن یک نقاشی از نزدیک می‌توان احساس عمق سه‌بعدی، ضربات قلم‌مو، رنگ‌های واقعی و مقیاس اثر را دریافت. برای اثبات این موضوع کافی است در یک آخر هفته‌ی تابستانی به لوور بروید و مونالیزا را ببینید؛ تمایل مردم برای دیدن این نقاشی از نزدیک، برای تجربه‌ی هاله‌ی آن، اصلاً با تکثیر گسترده‌ی آن کاهش نیافته است.

احتمالاً هوش مصنوعی بر اهمیت هنرهایی که بُعد فیزیکی دارند، تأکید بیشتری خواهد کرد؛ نقاشی‌هایی که در گالری‌ها به نمایش گذاشته می‌شوند و حتی بیشتر از آن، مجسمه‌سازی، که سه‌بعدی بودن آن به‌راحتی در تصویر دیجیتالی ایجادشده توسط هوش مصنوعی ثبت نمی‌شود. اجرای زنده‌ی موسیقی نیز، که در عصر اسپاتیفای و اپل موزیک بیش از همیشه محبوب است، قطعاً رونق بیشتری خواهد یافت. هوش مصنوعی نمی‌تواند ارتباط میان اجراکننده و مخاطب را در یک رویداد زنده بازسازی کند و این موضوع حتی اگر شروع به بازسازی گروه‌های محبوب گذشته با استفاده از آواتارهای دیجیتال کنیم، همچنان صادق است؛ مانند آنچه گروه ABBA در نمایش تئاتر موفق خود در لندن انجام داده است.

چالش برای هنر دیجیتالی که هیچ شکل فیزیکی ندارد، بیشتر است. اما همه‌گیری رو به افزایش هنرهای تولیدشده توسط هوش مصنوعی ممکن است محبوبیت توکن‌های غیرقابل‌تعویض (NFT) را دوباره زنده کند، جایی که یک اثر هنری دیجیتال اصلی دارای امضای رمزنگاری‌شده‌ای است که منحصربه‌فرد بودن آن را تأیید می‌کند.

دلایل همکاری انسان و هوش مصنوعی

هوش مصنوعی به‌تنهایی قادر به خلق هنر نیست. اما راه‌های تازه‌ای برای بیان هنری از طریق همکاری انسان و ماشین می‌گشاید. در سال‌های اخیر، برخی نویسندگان داستان به استفاده از چت‌بات‌های هوش مصنوعی به‌عنوان بخشی از فرآیند نویسندگی خود روی آورده‌اند. آجی چودری[29]، نویسنده‌ی بریتانیایی رمان‌های جنایی، از ChatGPT به‌عنوان شریکی برای ایده‌پردازی استفاده می‌کند. او نمی‌گذارد هوش مصنوعی نثر او را بنویسد؛ بلکه از آن برای کمک در طراحی نقاط عطف داستان بهره می‌برد. چودری می‌گوید: «به آن می‌گویم، “هی، اینجا گیر کرده‌ام، چند ایده بده.” و واقعاً در این کار فوق‌العاده است.»

در یکی از کتاب‌های اخیرش، شخصیت اصلی چودری درون یک انباری زندانی می‌شود. او نمی‌توانست راهی پیدا کند که شخصیتش بتواند به شکلی تازه و غیرمنتظره از آنجا فرار کند. ChatGPT به او کمک کرد تا ایده‌های جدیدی خلق کند، از جمله اینکه شخصیت بتواند با استفاده از ابزاری در انبار، خود انبار را از هم باز کند، ایده‌ای که پیش‌تر به ذهن چودری نرسیده بود.

چودری همچنین کتابی برای کودکان نوشت و قصد داشت آن را به یک رمان گرافیکی تبدیل کند، اما مطمئن نبود چگونه این کار را انجام دهد. بنابراین از ChatGPT خواست به او در طراحی استوری‌بورد کتاب کمک کند، از جمله پیشنهادهایی برای تصاویر به او ارائه دهد. ChatGPT پیش‌نویس اولیه‌ای از یک استوری‌بورد تولید کرد که شامل توصیف‌هایی سینمایی از «مونتاژ فلش‌بک» و زوایا و نماهای مختلف دوربین بود. چودری می‌گوید: «این دقیقاً چیزی است که به نظر من بسیار قدرتمند است، زیرا به من اجازه می‌دهد خلاقیتم را در ژانر و فرمتی که قبلاً انجام نداده‌ام، آزاد کنم.» با این حال، چودری قصد دارد برای تولید نسخه‌ی نهایی کتاب، با یک هنرمند حرفه‌ای همکاری کند. نقش هوش مصنوعی مولد در اینجا کمک به چودری برای تجسم نحوه‌ی روایت داستان است. این ابزار به ایده‌پردازی کمک می‌کند، نه اجرای محصول نهایی.

برخی دیگر از نویسندگان به هوش مصنوعی اجازه می‌دهند که بخشی از نثر آن‌ها را بنویسد. هانا سیلوا[30]، در کتاب خود “فرزند من، الگوریتم”، از GPT-J (یک مدل زبانی بزرگ که توسط گروه EleutherAI طراحی شده و قابلیت‌های اولیه‌ی مدل GPT-2 اوپن‌ای‌آی را تقلید می‌کند) استفاده کرد. این مدل می‌توانست متونی نسبتاً کوتاه و منسجم را در سبک‌های مختلف بنویسد، اما گاهی نیز به مسیرهای عجیب منحرف می‌شد، جملات نامرتبط می‌آورد، یا در تکرار یک عبارت یا کلمه گیر می‌کرد.

سیلوا که شاعری است با تجربه در زمینه‌ی شعر «یافت‌شده» (found poetry)، تکنیکی مشابه را در این کتاب به کار برد. در این نوع شعر، شاعر تکه‌های متنی را از روزنامه‌ها، مجلات، تابلوهای تبلیغاتی، ایمیل‌ها یا مکالمات ضبط‌شده انتخاب، کنار هم قرار می‌دهد و در کنار هم می‌نشاند. برای فرزند من، الگوریتم، او قطعاتی از متن‌های نوشته‌شده توسط GPT-J را با نوشته‌های خودش ترکیب کرد. تمامی متن‌هایی که توسط GPT-J نوشته شده‌اند، به‌صورت ایتالیک در کتاب مشخص شده‌اند تا خواننده بتواند آن‌ها را تشخیص دهد.

این کتاب، که مراقبت از یک کودک نوپا به‌عنوان مادری مجرد و تجربه‌ی سیلوا در زمینه‌ی روابط و عشق را به تصویر می‌کشد، از GPT-J برای بسط این موضوعات بهره می‌برد. مدل زبانی همچنین به‌عنوان ابزاری برای بازتاب و انعکاس ایده‌هایی درباره‌ی یادگیری، آموزش، هوش و عشق عمل می‌کند. روش سیلوا شامل آزمایش با دادن تکه‌هایی از نوشته‌های خودش به‌عنوان دستور به GPT-J و همچنین تنظیم دستی تنظیمات مدل، مانند «دما»ی پاسخ آن بود؛ معیاری که تعیین می‌کند پاسخ مدل چقدر می‌تواند از پاسخ‌های محتمل‌تر فاصله بگیرد. دمای بالاتر به معنای پاسخ‌هایی است که می‌توانند غیرعادی‌تر و خلاقانه‌تر باشند.

مدل‌های جدیدتر، در نسخه‌هایی که به کاربران عادی ارائه می‌شوند، معمولاً چنین کنترلی را ارائه نمی‌دهند. سیلوا همچنین با دقت از میان پاسخ‌های مدل انتخاب می‌کرد. بنابراین، اگرچه بخش‌هایی از متن فرزند من، الگوریتم، از جمله فصل‌هایی کامل، توسط GPT-J تولید شدند، اما نوشتن، انتخاب و ویرایش سیلوا برای شکل‌گیری نهایی این کتاب ضروری بود. او درباره‌ی نقش GPT-J در این کتاب می‌گوید: «من به آن اجازه دادم در بخش‌های مختلف کتاب نقش‌های متفاوتی ایفا کند. گاهی به‌عنوان زیرمتن عمل می‌کند. می‌تواند چیزهایی بگوید که من با صدای خودم نمی‌گویم.»

سیلوا اشاره می‌کند که تلاش‌ها برای «ایمن و بی‌ضرر» کردن مدل‌های زبانی بزرگ، این مدل‌ها را برای او به‌عنوان یک نویسنده کمتر مفید کرده است. او می‌گوید: «آن‌ها اکنون بسیار “بهتر” شده‌اند، اما همچنین عمومی‌تر و برای من به‌عنوان شریک نوشتن بسیار کم‌هیجان‌تر.» به گفته‌ی او، برخی از خلاقانه‌ترین و جالب‌ترین خروجی‌های GPT-J زمانی رخ می‌داد که مدل دچار مشکل می‌شد یا عبارتی را بارها تکرار می‌کرد.

سیلوا امیدوار است که نرم‌افزارهای هوش مصنوعی یک انقلاب خلاقانه را آغاز کنند، جایی که افراد بیشتری با آزمایش مدل‌های هوش مصنوعی، کتاب‌های جدیدی خلق کنند. او حتی امیدوار است که سهولت تولید داستان‌های ژانری و آثار کلیشه‌ای و مشتق‌شده که هوش مصنوعی فراهم می‌کند، قدردانی خوانندگان از ادبیات چالش‌برانگیز و فرم‌های تازه‌ی ادبی را افزایش دهد.

اد نیوتن‌رکس[31]، کارآفرین حوزه‌ی فناوری و آهنگساز، استفاده از هوش مصنوعی را به‌عنوان یک همکار موسیقایی آغاز کرده است. او از مدل GPT-3 اوپن‌ای‌آی برای نوشتن اشعار یک قطعه‌ی کُرال و پیانویی به نام “در کتابخانه ایستاده‌ام” استفاده کرد. این قطعه برای اولین بار در جشنواره‌ی آنلاین موسیقی کلاسیک Live From London در سال ۲۰۲۲ اجرا شد. نیوتن‌رکس همچنین از ابزارهای تولید موسیقی مبتنی بر هوش مصنوعی برای ایده‌پردازی عباراتی موسیقایی بهره می‌برد. اما برای این قطعه‌ی کُرال، او موسیقی را خودش نوشت و تنها از GPT-3 برای نوشتن اشعار استفاده کرد. جرقه‌ی نوشتن برای پیانو و آواز بعد از آن زده شد که GPT-3 شعری درباره‌ی یک پیانو تولید کرد. او در مورد استفاده از هوش مصنوعی مولد می‌گوید: «یکی از بزرگ‌ترین مزایای آن الهامی است که به شما می‌دهد.»

تاریخ همکاری انسان و ماشین در هنرهای تجسمی طولانی‌تر است و برخی هنرمندان اکنون این همکاری را به بخشی ضروری از سبک خود تبدیل کرده‌اند. دانیل آمبروسی[32]، به‌خاطر عکس‌های چشم‌انداز پانورامای بزرگ و هایپررئال[33] خود شناخته می‌شود. او این تصاویر را با ترکیب چندین عکس می‌سازد تا میدان دید، عمق بصری و حساسیت به نور را بیش از یک لنز دوربین، به چشم انسان نزدیک کند. آمبروسی این تکنیک را «عکاسی محاسباتی[34]» می‌نامد.

اما از سال ۲۰۱۶، آمبروسی این تصاویر دیجیتالی را از طریق نسخه‌ای سفارشی از مدل هوش مصنوعی DeepDream که توسط گوگل توسعه داده شده است، پردازش می‌کند. این مدل جلوه‌هایی بصری ظریف اما چشمگیر به آثار او اضافه می‌کند. DeepDream، که در سال ۲۰۱۵ بسیاری از هنرمندان بصری را تحت تأثیر قرار داد، به کاربران اجازه می‌دهد تا تصویری را به یک شبکه‌ی عصبی بدهند و سپس از نرم‌افزار بخواهند ویژگی‌هایی را که بیشترین تحریک را در گروه خاصی از نورون‌های شبکه ایجاد می‌کنند، تقویت کند. الکساندر موردوینتسف[35]، متخصص یادگیری ماشینی گوگل و مخترع این تکنیک، توضیح می‌دهد: «این شبیه به این است که به شبکه بگویید: “هر چیزی که آنجا می‌بینی، بیشتر از آن می‌خواهم!”»

کاربران می‌توانند تا حدی کنترل کنند که تصویر نهایی چگونه باشد، با انتخاب لایه‌ای از شبکه عصبی که برای این تقویت استفاده می‌شود. لایه‌های پایینی اطلاعات را به‌صورت انتزاعی پردازش می‌کنند و بیشتر بر خطوط و رنگ‌ها تمرکز دارند؛ لایه‌های بالاتر بر گروه‌هایی از پیکسل‌ها تمرکز می‌کنند که ویژگی‌هایی مانند ساختمان‌ها، دهان‌ها، یا بینی‌ها را نشان می‌دهند.

برای مجموعه‌ای از عکس‌های باغ‌های انگلیسی که توسط لانسلات «کیپبلیتی» براون[36]، هنرمند چشم‌انداز قرن هجدهم، طراحی شده‌اند، آمبروسی لایه‌هایی از الگوریتم DeepDream را انتخاب کرد که اشیائی مانند پوست درختان یا سنگ‌های خانه یا پل‌ها را به الگوهایی شبیه موزاییک پرمانند با چرخش‌های خاص تبدیل می‌کرد. پس از ویرایش‌های پساتولید با استفاده از Photoshop و ابزارهای دیجیتالی دیگر، آمبروسی این تصاویر را روی بوم‌هایی بزرگ شبیه به پارچه با جوهرهای حرارتی چاپ می‌کند و سپس بوم‌ها را روی جعبه‌های نوری سفارشی نصب می‌کند که با استفاده از LEDها آثار را روشن می‌کنند.

نتیجه، تصاویری است که همزمان هم هایپررئال و هم سورئال[37] به نظر می‌رسند و با جنبه‌ای نقاشانه همراه هستند که در عکس‌های معمولی یافت نمی‌شود. آمبروسی تأکید می‌کند که کلید کار او این است که از هوش مصنوعی به‌عنوان یک ابزار استفاده می‌کند، اما قطعه‌ی نهایی به هنر و تصمیم‌گیری انسانی وابسته است. او می‌گوید: «این ابزارها بی‌جان هستند، هیچ حس یا انگیزه‌ای ندارند. آن‌ها توسط انسان‌ها هدایت می‌شوند. انسان‌هایی با ایده‌هایی که باید نتایج را، همان‌طور که من انجام می‌دهم، گزینش کنند تا چشم‌اندازشان را ممکن کنند.» از دیدگاه آمبروسی، این چشم‌انداز (آنچه هنرمند می‌خواهد بیان کند) مهم است.

بر همین اساس، او پیش‌بینی می‌کند که تأثیر هوش مصنوعی بر بازار هنرهای زیبا حداقلی خواهد بود. به گفته‌ی او، بیشتر هنرمندان این حوزه در حال حاضر برای گذران زندگی به سختی تلاش می‌کنند و تنها به‌خاطر نیروی درونی برای بیان خود به کار هنری می‌پردازند. تعداد اندکی از آن‌ها آثار خود را همزمان اصیل و مورد توجه گالری‌داران و مجموعه‌داران می‌یابند. آمبروسی معتقد است که این وضعیت تغییر نخواهد کرد.

او با عکاسان و تصویرگران تجاری که ممکن است به‌دلیل گسترش هوش مصنوعی دچار ضرر اقتصادی شوند، ابراز همدردی می‌کند، اما همچنین فکر می‌کند این مسئله بخشی اجتناب‌ناپذیر از پیشرفت فناوری است. در عین حال، آمبروسی معتقد است که هوش مصنوعی ممکن است فرصت‌های جدیدی را برای مردم فراهم کند تا به هنرمندان هنرهای زیبا تبدیل شوند. او می‌گوید فارغ‌التحصیلان رشته‌های علوم انسانی که موضوعاتی مانند ادبیات انگلیسی و تاریخ هنر را مطالعه کرده‌اند، ممکن است تقاضای زیادی پیدا کنند، زیرا آن‌ها قادر خواهند بود بهترین ایده‌ها را برای تصاویر دیجیتال تولیدشده توسط هوش مصنوعی ارائه دهند (تصاویری که هم طنین تاریخی و هم معاصر داشته باشند) و در دادن دستورالعمل به مدل‌های هوش مصنوعی برای دستیابی به این نتایج مهارت داشته باشند. او می‌گوید: «این افراد ممکن است هرگز قلم‌مویی به دست نگرفته باشند یا هیچ هماهنگی چشم و دستی نداشته باشند. اما آن‌ها یک ذخیره‌ی عمیق از دانش تاریخ هنر دارند. آن‌ها می‌دانند چگونه گزینش کنند. آن‌ها تفاوت بین هنر بزرگ و متوسط را می‌دانند و اکنون ابزاری در اختیار دارند که به آن‌ها امکان خلق آثاری واقعاً شگفت‌انگیز را می‌دهد.»

فناوری همچنین ممکن است خلق هنر را برای افراد دارای معلولیت آسان‌تر کند. چاک کلوز[38]، نقاش آمریکایی که پس از یک آسیب نخاعی تا حدی فلج شده بود و از ویلچر استفاده می‌کرد، در نهایت یاد گرفت با استفاده از قلم‌موهایی که به مچ دستش بسته می‌شدند نقاشی کند. اما اکنون افراد فلج می‌توانند تنها با دستور دادن از طریق فناوری‌های تشخیص صدا یا حتی با استفاده از فناوری‌های کمکی ردیابی چشم یا زبان، تصاویر زیبایی خلق کنند.

همه‌چیز، همه‌جا، هم‌زمان

صحنه: تئاتر دالبی[39] در لس‌آنجلس، یک بعدازظهر آفتابی در یک روز یکشنبه در ماه مارس، چند سال بعد.

یک زن جوان از یک خودروی مشکی بیرون می‌آید و روی فرش قرمز قدم می‌گذارد. او لباسی قرمز رنگ و کفش‌های پاشنه بلند به پا دارد. در میان فلاش‌های دوربین‌های پاپاراتزی، او به نظر می‌رسد که گیج شده است. هوادارانی که در دو سوی فرش قرمز صف کشیده‌اند، او را صدا می‌زنند تا با آن‌ها سلفی بگیرد. در ابتدا مردد است، اما در نهایت تسلیم می‌شود و برای عکاسی می‌ایستد. درست پیش از ورود به سالن تئاتر، یک خبرنگار تلویزیونی او را کنار می‌کشد. خبرنگار می‌پرسد: «اِما، وقتی سال گذشته در خوابگاهت در NYU بودی و به داستان فیلم ستاره‌های مغایر فکر می‌کردی، آیا فکر می‌کردی روزی در مراسم اسکار باشی؟» اِما سرخ می‌شود و رنگ گونه‌هایش تقریباً با رنگ لباسش همخوانی پیدا می‌کند. او پاسخ می‌دهد: «اصلاً. همه‌ی این‌ها مثل یک رویای تحقق‌یافته است.»

ساعاتی بعد، در داخل سالن تئاتر، اِما هومان به روی صحنه می‌رود تا جایزه‌ی اسکار بهترین کارگردانی را دریافت کند. کمدی رمانتیک میان‌کهکشانی او به نام ستاره‌های مغایر اولین فیلمی است که جایزه‌ی اسکار را دریافت می‌کند و کاملاً توسط یک دانشجو در یک خوابگاه با استفاده از نرم‌افزار هوش مصنوعی، بدون کمک تیم تولید یا بازیگر ساخته شده است.

این ممکن است خیالی به نظر برسد، اما تا پنج سال دیگر، ساخت یک فیلم موفق دقیقاً به همین شیوه ممکن خواهد بود. هوش مصنوعی مولد هزینه‌ی تولید فیلم و موسیقی را به‌شدت کاهش خواهد داد و تولید هنر تجاری را در دسترس نسل جدیدی از خالقان، بدون هیچ‌گونه آموزش رسمی قرار خواهد داد.

این دگرگونی سه گروه را منتفع خواهد کرد:

اول؛ خالقان جدید: این نسل جدید از خالقان قادر خواهند بود آثار جذابی تولید کنند و شاید مخاطبانی پیدا کنند. اما همان‌طور که خالقان شبکه‌های اجتماعی امروزی وابسته به الگوریتم‌های پیشنهادی مبتنی بر هوش مصنوعی هستند، این هنرمندان نیز ممکن است مجبور شوند برای ارتباط با خوانندگان، شنوندگان و بینندگان خود به دستیاران شخصی هوش مصنوعی یا الگوریتم‌های بزرگ شرکت‌های فناوری (مانند TikTok، Meta، Apple، Microsoft یا OpenAI) متکی باشند.

دوم؛ شرکت‌های حقوق‌دار محتوا: سازمان‌هایی که حقوق آرشیو‌های گسترده‌ای از محتوا را در اختیار دارند، مانند شرکت‌های موسیقی، استودیوهای هالیوود، آژانس‌های عکاسی، انتشارات و شاید موزه‌های بزرگ هنر، به دلیل داشتن داده‌هایی که شرکت‌های هوش مصنوعی به آن‌ها نیاز خواهند داشت، از این تغییر سود خواهند برد. این داده‌ها احتمالاً برای آموزش نرم‌افزارهای هوش مصنوعی به قیمت گزاف فروخته خواهند شد. در نتیجه، هوش مصنوعی، که به نظر می‌رسد تکنولوژی‌ای مختل‌کننده باشد، ممکن است به تثبیت وضعیت موجود کمک کند.

سوم؛ ستارگان شناخته‌شده: فناوری هوش مصنوعی برای هنرمندان و ستارگان بزرگ یک امتیاز ویژه خواهد بود. شهرت و آثار گذشته‌ی آن‌ها از همیشه باارزش‌تر خواهد شد. این افراد می‌توانند محتوای بیشتری در سبک منحصربه‌فرد خود تولید کنند و آن را سریع‌تر و در رسانه‌های متنوع‌تری از هر زمان دیگری عرضه کنند.

برخی ستارگان در حال درک فرصت‌های جدیدی برای گسترش برند شخصی خود هستند. متا میلیون‌ها دلار به افرادی چون پاریس هیلتون[40]، تام بردی[41]، مستر بیست[42] و اسنوپ داگ[43] پرداخت کرده تا چت‌بات‌هایی خلق کنند که از آواتارهای آن‌ها استفاده کرده و سبک گفت‌وگویشان را تقلید می‌کند. جیمز ارل جونز[44]، بازیگر مشهور، حقوق صدای خود را برای همیشه به دیزنی فروخته است. هوش مصنوعی به بازآفرینی صدای جان لنون[45] برای آخرین آهنگ بیتلز کمک کرد. گرایمز[46] ترانه‌سرا از هوش مصنوعی برای شبیه‌سازی صدای خود استفاده کرده و به دیگران نیز اجازه داده تا همین کار را انجام دهند، به شرطی که حق‌الامتیاز حاصل را با او به اشتراک بگذارند.

برای ستارگان، هوش مصنوعی به‌عنوان یک ابرقدرت گسترش برند عمل می‌کند و آنچه اکونومیست[47] در یک مقاله‌ی جلد خود به آن لقب «تولد ابرستاره» داده است، ممکن می‌سازد.

افرادی که بیشتر در معرض خطر قرار دارند، هنرمندان تجاری و بازیگران متوسط هستند. این‌ها افرادی هستند که مهارت کافی برای کسب درآمد از حرفه‌ی خود دارند، اما استعدادشان آن‌قدر منحصربه‌فرد نیست که آن‌ها را به ستاره تبدیل کند. شرکت‌های فناوری که نرم‌افزارهای هوش مصنوعی می‌سازند، احتمالاً آثار این افراد را آن‌قدر منحصربه‌فرد یا مهم نمی‌دانند که بخواهند هزینه‌ی زیادی برای آن بپردازند. آن‌ها می‌گویند داده‌های مشابه را می‌توانند از جاهای دیگر به دست آورند.

در بسیاری از موارد، هنرمندان حتی در مذاکرات حضور ندارند، چرا که پیش‌تر حقوق آن تصاویر، صداهای ضبط‌شده یا فیلم‌ها را به شرکت‌های بازی‌سازی، ناشران مجلات، شرکت‌های موسیقی یا استودیوهای هالیوود فروخته‌اند. شرکت‌های فناوری که در حال آموزش مدل‌های هوش مصنوعی هستند، می‌خواهند با این نهادها برای خرید کل بانک داده‌ها مذاکره کنند.

این پویش احتمالاً باعث افزایش تنش میان هنرمندان و موسیقی‌دانان تجاری با صاحبان حقوق مالکیت خواهد شد. پیش‌بینی می‌شود که هنرمندان بیشتری به تشکیل اتحادیه‌ها یا انجمن‌ها روی آورند تا بتوانند برای مجموعه‌های بزرگ داده به‌صورت جمعی مذاکره کنند.

کارلا اورتیز[48]، هنرمند تجسمی که برای استودیوهای هالیوود و شرکت‌های بازی‌سازی کار کرده است، در خط مقدم تلاشی نوظهور برای سازمان‌دهی هنرمندان قرار دارد. او نه تنها از شرکت‌های هوش مصنوعی به دلیل نقض حق‌کپی‌رایت شکایت کرده است، بلکه خواستار دریافت غرامت عادلانه نیز شده است.

درحالی‌که هوش مصنوعی فرصت‌های گسترده‌ای برای خالقان جدید و ستارگان فراهم می‌کند، این فناوری برای هنرمندان متوسط چالش‌های بزرگی ایجاد خواهد کرد. با این وجود، امکان دسترسی به ابزارهای هوش مصنوعی ممکن است زمینه را برای خلاقیت بیشتر و ورود افراد بیشتری به دنیای هنر باز کند. در این میان، پرسش‌های مهمی درباره‌ی حقوق هنرمندان و اخلاق استفاده از آثار آن‌ها مطرح است که نیاز به بررسی عمیق‌تر دارد.

عشق و سرقت

ارتباط میان هنر و سرقت، تاریخی طولانی دارد. جمله‌ی معروف «هنرمندان خوب قرض می‌گیرند، هنرمندان بزرگ می‌دزدند.» اغلب به پابلو پیکاسو[49] نسبت داده می‌شود، هرچند احتمالاً داستانی جعلی است. دیوید بویی[50] نیز گفته بود: «تنها هنری که مطالعه خواهم کرد، چیزهایی است که بتوانم از آن‌ها سرقت کنم.» امروز بحث‌های داغی پیرامون این موضوع وجود دارد که آیا آنچه هوش مصنوعی انجام می‌دهد، مشابه این نوع “سرقت” هنری است یا چیزی بسیار مشکوک‌تر از نظر قانونی و اخلاقی.

آنچه واضح است این است که مدل‌های هوش مصنوعی مولد محبوب امروزی بر اساس حجم عظیمی از مواد دارای حق‌کپی‌رایت، بدون کسب اجازه، آموزش دیده‌اند. همچنین مشخص شده است که این مدل‌ها، با دستورالعمل‌های مناسب، می‌توانند نسخه‌های دقیقاً مشابهی از آثاری که در حین آموزش جذب کرده‌اند تولید کنند. پیامدهای قانونی این موضوع پیچیده و هنوز حل‌نشده‌اند.

اگرچه ممکن است دادگاه‌ها حکم دهند که آموزش مدل‌های هوش مصنوعی به‌خودی‌خود نقض حق‌کپی‌رایت نیست یا کنگره استثنایی جدید برای آموزش هوش مصنوعی ایجاد کند، اما شرکت‌های هوش مصنوعی به دلایل اخلاقی و عملی به‌طور فزاینده‌ای مجبور خواهند شد برای مجوز استفاده از داده‌های آموزشی هزینه پرداخت کنند. در عین حال، مشکل خروجی‌های هوش مصنوعی که حقوق کپی‌رایت را نقض می‌کنند، یک معضل حقوقی برای شرکت‌های سازنده‌ی این مدل‌ها خواهد بود که احتمالاً با فناوری‌های فیلترسازی آن را حل خواهند کرد.

مجموعه‌ی داده‌های آموزشی GPT-4 هنوز ناشناخته است، اما مدل پیشین آن، GPT-3، از جمله بر روی Common Crawl آموزش دیده است. (مجموعه‌ای عظیم از صفحات وب که از اینترنت جمع‌آوری شده‌اند و حاوی حجم زیادی از مواد دارای حق‌کپی‌رایت هستند.) در همین حال، مدل زبانی Meta’s Llama، مدل GPT-J گروه EleutherAI، نسخه‌ی اولیه‌ی BloombergGPT و بسیاری از مدل‌های دیگر بر اساس مجموعه‌ی داده‌ای به نام Books3 آموزش دیده‌اند.

Books3 شامل متن کامل ۱۷۰,۰۰۰ کتاب است که بیشتر آن‌ها در بیست سال گذشته منتشر شده و دارای حق‌کپی‌رایت هستند، به گفته‌ی تحقیقی که الکس رایسنر[51]، روزنامه‌نگار و برنامه‌نویس، برای آتلانتیک انجام داده است. این مجموعه شامل آثاری از نویسندگان مشهوری مانند استیون کینگ[52]، جیمز پترسون[53]، زیدی اسمیت[54]، جاناتان فرانزن[55]، هاروکی موراکامی[56] و مارگارت اتوود[57] است.

مدل‌های تولید تصویر متنی به تصویری مانند Stable Diffusion نیز بر اساس مجموعه داده‌ی LAION 5-B آموزش دیده‌اند که خود از Common Crawl گرفته شده است. این مجموعه شامل حجم زیادی از تصاویر دارای حق‌کپی‌رایت از هنرمندان و عکاسان، چه مشهور مانند دیمین هرست[58] و کیهنده وایلی[59] و چه کمتر شناخته‌شده، است.

مدل‌های تولید موسیقی نیز بر اساس آهنگ‌های دارای حق‌کپی‌رایت آموزش دیده‌اند.

دادگاه‌های ایالات متحده قرار است در چند پرونده‌ی تاریخی حکم دهند که آیا این مدل‌های هوش مصنوعی حق‌کپی‌رایت را نقض می‌کنند یا خیر. دفتر کپی‌رایت ایالات متحده نیز در حال بررسی این است که آیا قوانین یا مقررات جدیدی برای این موضوع مورد نیاز است. اما کارشناسان کپی‌رایت در این‌باره اختلاف نظر دارند. برخی معتقدند قضات ممکن است آموزش مدل‌های هوش مصنوعی را به‌عنوان نقض حق‌کپی‌رایت تلقی کنند، در حالی که برخی دیگر استدلال می‌کنند این امر می‌تواند در چارچوب استفاده‌ی منصفانه (Fair use) قرار گیرد. (اصلی قانونی که در شرایط خاص به افراد اجازه می‌دهد بدون کسب اجازه از مواد دارای کپی‌رایت استفاده کنند.)

این بحث‌ها در حالی ادامه دارد که مدل‌های هوش مصنوعی مولد به‌سرعت در حال تحول‌اند و استفاده از آن‌ها گسترده‌تر می‌شود. تعیین تکلیف قانونی و اخلاقی این فناوری نه تنها بر حقوق هنرمندان و نویسندگان تأثیر می‌گذارد، بلکه آینده‌ی خلاقیت و نحوه‌ی تعامل ما با هنر و فرهنگ را نیز شکل خواهد داد.

استفاده‌ی ناعادلانه

با اینکه برخی از حقوقدانان استدلال می‌کنند که تعمیم استفاده‌ی منصفانه (Fair use) به آموزش هوش مصنوعی ممکن است نوآوری را تسهیل کند، برخی دیگر بر این باورند که چنین اقدامی غیراخلاقی خواهد بود. بنجامین سوبل[60]، حقوقدان دانشگاه هاروارد، در مقاله‌ای تأثیرگذار در سال ۲۰۱۷، اشاره می‌کند که استفاده‌ی منصفانه بر اصول عدالت توزیعی استوار است. این اصل عمدتاً در مواردی به کار رفته است که اثر آن انتقال قدرت از صاحبان قدرت به افراد کم‌نفوذتر بوده است.

اما سوبل معتقد است که هوش مصنوعی این منطق را وارونه می‌کند. در اینجا، کسانی که حقوق کپی‌رایت آن‌ها نقض می‌شود، شامل هزاران هنرمند متوسط هستند، در حالی که بهره‌مندان از این نقض، شرکت‌های فناوری عظیم و استارت‌آپ‌های ثروتمند هستند. این وضعیت بیشتر به «استفاده‌ی ناعادلانه» شبیه است تا استفاده‌ی منصفانه. بنابراین، سوبل استدلال می‌کند که استفاده‌ی منصفانه نباید به شرکت‌های فناوری برای آموزش نرم‌افزارهای هوش مصنوعی تعمیم داده شود.

نیل تورکویتز[61]، یکی از منتقدان برجسته‌ی استفاده‌ی شرکت‌های فناوری از آثار دارای حق‌کپی‌رایت برای آموزش هوش مصنوعی، این موضوع را عمیقاً نگران‌کننده می‌داند. تورکویتز، که پیش‌تر در صنعت ضبط موسیقی فعالیت داشته است، استدلال می‌کند که ما در آغاز عصر شبکه‌های اجتماعی اشتباه کردیم. نباید اجازه می‌دادیم که سوابق دیجیتال شخصی ما، از عکس‌ها و داستان‌ها گرفته تا روابط اجتماعی، سوابق کاری و اطلاعات پزشکی بدون درک واقعی از عواقب آن توسط شرکت‌های بزرگ فناوری ضبط و بهره‌برداری شوند.

تورکویتز می‌گوید که این بار باید محتاط‌تر عمل کنیم و رضایت واضح و آزادانه اعطا شده را به محور آینده‌ی مبتنی بر هوش مصنوعی تبدیل کنیم. او استدلال می‌کند که هنرمندان باید خودشان انتخاب کنند که آیا می‌خواهند آثارشان در مجموعه‌داده‌های آموزشی هوش مصنوعی گنجانده شود یا خیر. به گفته‌ی او، هر چیزی کمتر از این، به معنای ساختن دنیای جدیدی است که بر پایه‌ی سرقت و کار بدون دستمزد بنا شده است.

برخی از حقوقدانان برجسته خواستار قوانین جدیدی هستند. مارک لملی[62]، مدیر برنامه‌ی حقوق، علم و فناوری دانشگاه استنفورد، پیشنهاد می‌کند که کنگره‌ی آمریکا باید حق قانونی جدیدی به نام آموزش منصفانه (Fair learning) ایجاد کند که به سیستم‌های هوش مصنوعی اجازه دهد از آثار دارای حق‌کپی‌رایت برای آموزش استفاده کنند. به گفته‌ی لملی، اصرار بر اینکه شرکت‌های فناوری از تک‌تک صاحبان حقوق اجازه بگیرند، غیرعملی است و نوآوری در ایالات متحده را متوقف می‌کند. در مقابل، مدافعان هنرمندان و صاحبان حقوق تلاش می‌کنند کنگره را متقاعد کنند که برخلاف پیشنهاد لملی عمل کرده و صریحاً استفاده‌ی غیرمجاز از مواد دارای حق‌کپی‌رایت برای آموزش سیستم‌های هوش مصنوعی را ممنوع کند.

برخی کشورها، از جمله تایوان، اسرائیل، سنگاپور، کره جنوبی، بریتانیا و ۲۷ کشور عضو اتحادیه‌ی اروپا، قبلاً استثنائاتی در قوانین کپی‌رایت برای استخراج داده‌ها (Data Mining) ایجاد کرده‌اند. اما حقوقدانان بر سر این موضوع بحث می‌کنند که آیا تعریف استخراج داده در این قوانین، که بیشتر آن‌ها قبل از ظهور ChatGPT تصویب شده‌اند، شامل هوش مصنوعی مولد نیز می‌شود یا خیر. ژاپن بیشترین گام را برای مجاز کردن صریح آموزش هوش مصنوعی بر اساس آثار دارای کپی‌رایت برداشته است.

بحث بر سر اینکه آیا خروجی‌های مدل‌های هوش مصنوعی باید مشمول حقوق کپی‌رایت شوند یا خیر، نیز جنجالی است. تاکنون، دفتر کپی‌رایت ایالات متحده از اعطای کپی‌رایت به این آثار خودداری کرده و اعلام کرده است که تنها آثار خلق‌شده توسط انسان می‌توانند محافظت شوند.

آنچه مسلم است، این است که قوانین شفاف به‌شدت مورد نیاز هستند. هم شرکت‌های هوش مصنوعی و هم هنرمندان به وضوح در این زمینه نیاز دارند و اتکا به یک رویکرد مبتنی بر حقوق عرفی، که تصمیم‌گیری درباره‌ی استفاده‌ی منصفانه را به قضات و پرونده‌های خاص واگذار می‌کند، این وضوح را فراهم نمی‌کند.

درحالی‌که نگرانی‌های هنرمندان قابل درک است، ممنوعیت استفاده از مواد دارای حق‌کپی‌رایت برای آموزش هوش مصنوعی به‌طور کلی ممکن است چندان منطقی نباشد. ایالات متحده باید از سایر کشورها پیروی کرده و ماده‌ای قانونی برای آموزش منصفانه تصویب کند. اما در ازای این استفاده‌ی غیرمجاز، هنرمندان می‌توانند از طریق سیستمی که هزینه‌ای از سازندگان و توزیع‌کنندگان مدل‌های هوش مصنوعی دریافت می‌کند، غرامت دریافت کنند. این پول می‌تواند به صندوقی اختصاص یابد که صاحبان حقوق بتوانند برای دریافت مبلغی ثابت به ازای هر اثر دارای کپی‌رایت درخواست کنند، یا به خیریه‌هایی که از کارهای هنری حمایت می‌کنند، اختصاص داده شود.

چنین سیستمی نه تنها هزینه‌ی آموزش مدل‌های هوش مصنوعی را پوشش می‌دهد، بلکه می‌تواند از نیاز شرکت‌های فناوری به توافق‌های جداگانه با صاحبان حقوق جلوگیری کند. این رویکرد بی‌سابقه نیست؛ قانون ضبط صوتی خانگی[63] که در سال ۱۹۹۲ تصویب شد، به سازندگان فناوری ضبط صوت دیجیتال اجازه داد تا از مسئولیت نقض کپی‌رایت فرار کنند، به شرطی که هزینه‌ای پرداخت کنند که برای جبران موسیقی‌دانان و شرکت‌های موسیقی استفاده شود. بااین‌حال، خروجی‌های طراحی‌شده برای تقلید صریح از سبک خاص یک هنرمند برای اهداف تجاری، باید با رضایت آن هنرمند همراه باشد. همچنین، با گسترش استفاده از هوش مصنوعی به‌عنوان ابزاری برای هنرمندان انسانی، معقول است که محافظت از کپی‌رایت به آثاری که نتیجه‌ی همکاری گسترده‌ی یک خالق انسانی و هوش مصنوعی هستند، گسترش یابد.

فنس‌کشی اینترنت

در حالی که دولت‌ها هنوز بر سر نحوه به‌روزرسانی قوانین کپی‌رایت تردید دارند، صاحبان حقوق مشغول ایجاد موانع دیجیتالی هستند که از دسترسی سیستم‌های هوش مصنوعی به محتوای اینترنتی آن‌ها بدون اجازه جلوگیری می‌کند. بسیاری از سازمان‌های خبری، شروع به مسدود کردن ربات‌هایی کرده‌اند که داده‌ها را برای شرکت‌های هوش مصنوعی خاص، مانند OpenAI، استخراج می‌کنند. در برخی موارد، این سازمان‌ها پروتکل‌هایی معرفی کرده‌اند که همه ربات‌های استخراج داده را متوقف می‌کند، اما این روش‌ها ممکن است مانع از نمایش صفحات وب در جستجوهای گوگل نیز شود. در همین حال، بسیاری از سایت‌های تجارت الکترونیک، چالش‌های CAPTCHA را برای بازداشتن ربات‌های خزنده وب به کار گرفته‌اند.

برخی هنرمندان حتی قدمی فراتر گذاشته و «ماسک‌های دیجیتالی» را روی تصاویر آثارشان اعمال می‌کنند که این تصاویر را برای مدل‌های هوش مصنوعی بی‌فایده کرده یا حتی به مدل‌ها آسیب می‌زند و عملکردشان را مختل می‌کند. بن ژائو[64]، استاد علوم کامپیوتر در دانشگاه شیکاگو، ابزاری به نام Glaze ساخته که خودش بر پایه هوش مصنوعی است و به حفاظت از آثار هنری کمک می‌کند. به جای صرفاً ایجاد یک مانع دور محتوای هنرمند در اینترنت، Glaze مانند داغ‌زدن بر روی گاوها عمل می‌کند تا دزدها را از بهره‌برداری از آن‌ها بازدارد. Glaze مدل‌های هوش مصنوعی را فریب می‌دهد تا تصویر را به‌عنوان سبکی کاملاً متفاوت از هنر دسته‌بندی کنند. به‌عنوان مثال، مدلی ممکن است یک طراحی با زغال را وارد کند اما آن را به‌عنوان یک نقاشی انتزاعی طبقه‌بندی کند. این کار باعث می‌شود که کسی نتواند از نام هنرمند به‌عنوان کلیدواژه برای تولید آثار مشابه استفاده کند یا تصاویر او را برای تنظیم مدل هوش مصنوعی به‌منظور تقلید از سبک منحصربه‌فردش به کار گیرد. Glaze تغییرات جزئی در تصویر دیجیتال ایجاد می‌کند که برای چشم انسان تقریباً غیرقابل تشخیص است، اما موجب این اشتباه در طبقه‌بندی می‌شود.

ژائو اخیراً قدمی فراتر برداشته و نرم‌افزاری به نام Nightshade ساخته است. این نرم‌افزار نه‌تنها آثار یک هنرمند خاص را ماسک می‌کند، بلکه کل مدل را مسموم می‌کند و توانایی آن را برای پاسخ‌دهی به درخواست‌های مربوط به اشیاء و سبک‌های هنری مختلف، نه‌فقط نام هنرمند، مختل می‌کند. اگر Glaze مانند داغ‌گذاری روی گاو باشد، Nightshade شبیه به تله‌گذاری با اورانیوم-۲۳۵ است. هرچه تصاویر بیشتری با Nightshade آلوده شوند و مدل آن‌ها را بخورد، عملکرد آن بدتر می‌شود. استفاده از Glaze که بیش از ۱.۵ میلیون بار دانلود شده است، به سرعت در حال تبدیل شدن به یک روش استاندارد برای هنرمندانی است که آثار خود را به صورت آنلاین منتشر می‌کنند. ژائو می‌گوید مدارس هنر شروع به آموزش استفاده از این ابزار کرده‌اند و او به کنفرانس‌های هنر دیجیتال رفته تا اطلاعات بیشتری درباره نرم‌افزار ارائه دهد.

به زودی، ممکن است تصاویر به‌قدری با این روش‌ها پوشیده یا با Nightshade مسموم شوند که شرکت‌های فناوری مجبور به مذاکره برای پرداخت غرامت شوند. از ژائو درخواست شده که ابزارهای مشابهی برای محافظت و مسموم کردن داده‌ها در زمینه‌های دیگر، مانند موسیقی و ادبیات، ایجاد کند. اما این روش‌ها به سادگی قابل اعمال به این حوزه‌ها نیستند، گرچه او و دیگران در حال بررسی گزینه‌های ممکن هستند. حتی اگر دادگاه‌ها یا قانون‌گذاران استانداردی به نام «آموزش منصفانه» برای مدل‌های هوش مصنوعی تعیین کنند، این ابزارهای دیجیتال ضدسرقت، به زودی شرکت‌های فناوری را مجبور به اخذ مجوز داده خواهند کرد. این مذاکرات مجوز ممکن است مناقشه‌برانگیز باشند، اما عصر ساخت مدل‌ها از داده‌های رایگان به پایان رسیده است.

در مسیر هنر سنتائوری

تلاش‌های آزمایشی نویسندگانی مانند چودری و سیلوا، موسیقی‌دانانی مانند نیوتون-رکس و هنرمندانی مانند آمبروسی، به ما نشان می‌دهند که چرا باید کمتر از هوش مصنوعی مولد بترسیم، برخلاف آنچه برخی منتقدان می‌خواهند باور کنیم. همان‌طور که در اینجا استدلال کرده‌ام، هوش مصنوعی نمی‌تواند به‌تنهایی هنر خلق کند؛ تنها ما، با نیت‌ها، انگیزه‌های درونی، احساسات و تجربیات زیسته‌مان، قادر به این کار هستیم. در مورد مهارت‌های خلاقانه هوش مصنوعی نیز باید گفت که این توانایی‌ها همچنان در مقایسه با توانایی‌های ما بسیار کم‌رنگ‌تر هستند.

این وضعیت فضایی گسترده برای همکاری‌های انسان و هوش مصنوعی باقی می‌گذارد، درست مانند بسیاری دیگر از حرفه‌ها. می‌توان این همکاری را «هنر سنتائور[65]» نامید. (اصطلاحی برگرفته از «شطرنج سنتائور»، که به مسابقات شطرنجی اشاره دارد که در آن حریفان انسانی اجازه دارند از نرم‌افزارهای مشاوره‌ای استفاده کنند.) گفتن اینکه ما بر لبه‌ی یک رنسانس جدید در هنر ایستاده‌ایم، اغراق‌آمیز خواهد بود، اما به همان اندازه نیز فاصله زیادی با یک دوران تاریک جدید پر از عدم اصالت و تقلید داریم.

کلاژ و بازترکیب، ارجاع و تلفیق هنری، بیش از یک قرن است که در هنر رو به افزایش بوده‌اند، اما این روند هرگز اختراع سبک‌ها و فرم‌های جدید را از میان نبرده است. هر فناوری جدید (از رنگ روغن گرفته تا دوربین و سینتی‌سایزر موسیقی) اشکال تازه‌ای از بیان هنری را ممکن ساخته است. هوش مصنوعی نیز این چرخه را ادامه خواهد داد، نه اینکه به آن پایان دهد.

[1] Walter Benjamin

[2] David Hockney

[3] Impressionism

[4] Photorealism

[5] Democratization

[6] Avant-garde

[7] Renaissance

[8] Tech bro

[9] David Eagleman

[10] Anthony Brandt

[11] The Runaway Species: How Human Creativity Remakes the World

[12] Michael Chabon

[13] The Creative Brain: How Insight Works

[14] The Starry Night – Painting by Vincent van Gogh

[15] Norman Rockwell

[16] Isaiah

[17] Sistine Chapel

[18] Michelangelo

[19] J. P. Guilford

[20] Johann Sebastian Bach

[21] The Well-Tempered Clavier

[22] Broken Obelisk – Sculpture by Barnett Newman

[23] Ahmed Elgammal

[24] Moby-Dick – by Herman Melville

[25] Edmond de Belamy

[26] Obvious Art

[27] Nick Cave

[28] Marcel Duchamp

[29] Ajay Chowdhury

[30] Hannah Silva

[31] Ed Newton-Rex

[32] Daniel Ambrosi

[33] Hyperrealism

[34] Computational Photography

[35] Alexander Mordvintsev

[36] Lancelot “Capability” Brown

[37] Surrealism

[38] Chuck Close

[39] Dolby Theatre

[40] Paris Hilton

[41] Tom Brady

[42] MrBeast

[43] Snoop Dogg

[44] James Earl Jones

[45] John Lennon

[46] Grimes

[47] The Economist

[48] Karla Ortiz

[49] Pablo Picasso

[50] David Bowie

[51] Alex Reisner

[52] Stephen King

[53] James Patterson

[54] Zadie Smith

[55] Jonathan Franzen

[56] Haruki Murakami

[57] Margaret Atwood

[58] Damien Hirst

[59] Kehinde Wiley

[60] Benjamin Sobel

[61] Neil Turkewitz

[62] Mark Lemley

[63] Audio Home Recording Act

[64] Ben Zhao

[65] کلمه سنتائوری (Centaur) از اساطیر یونانی است که به‌عنوان موجودی ترکیبی از انسان و اسب به کار می‌رود. در دنیای معاصر، “هنر سنتائوری” به مفهوم ترکیب انسان و ماشین در فرآیندهای خلاقانه و هنری اشاره دارد.

نوشته‌ای ازmobin_khayati

درباره فناوری، هوش مصنوعی، کسب‌وکار و کیفیت تصمیم‌گیری.

یادداشت بعدی برای خواندن