هوش مصنوعی مولد (Generative AI) چیست؟
💡 این متن «بازنویسی آزاد» است: ایدهها و مفاهیم مطلب اصلی با نگارش کاملاً مستقل فارسی و مثالهای تازه بازگو شدهاند و ترجمهٔ کلمهبهکلمه نیست. بخشهای افزودهٔ مترجم در جعبهٔ منبع مشخص شدهاند.
هوش مصنوعی متعارف دادهٔ موجود را تحلیل میکند. هوش مصنوعی مولد چیز تازهای میسازد.
و همین یک تفاوت، نقش طراح را عوض میکند: از سازنده به کارگردان.
تعریف
هوش مصنوعی مولد به دستهای از الگوریتمها و مدلها گفته میشود که برای تولید خودمختار محتوا طراحی شدهاند — متن، تصویر، موسیقی، یا شکلهای دیگر داده. و این کار را با یادگرفتن الگوها و ساختارها از مجموعهدادهٔ عظیم انجام میدهند.
و تفاوت کلیدیاش با هوش مصنوعی سنتی این است: سنتی از قاعدههای ازپیشتعریفشده پیروی میکند و مولد خروجی کاملاً تازه میسازد، معمولاً در پاسخ به یک پرامپت.
چطور کار میکند
پایهاش شبکههای عصبی است: مدلهای محاسباتی الهامگرفته از مغز انسان، با گرههای بههمپیوستهای که اطلاعات را پردازش میکنند.
و دو نوع مدل مولد اصلی معرفی شدهاند.
شبکههای مولد تخاصمی، که در ۲۰۱۴ معرفی شدند. ساختارشان دو بخش دارد که رقابتی کار میکنند: مولد و تمیزدهنده، تا جایی که مولد بتواند تمیزدهنده را فریب دهد.
و بهترین کاربردشان تصویر فوقواقعگرایانه، انتقال سبک، و ساختن تصویر تازه از صفر است.
خودرمزگذارهای وردشی، که در ۲۰۱۳ معرفی شدند. رمزگذار ورودی را به یک فضای متغیر میبرد — و همینجا تنوع اضافه میشود — و رمزگشا آن را بازسازی میکند.
و کاربردشان بیشتر نویزدایی داده، تشخیص ناهنجاری، و ساختن دادهٔ تازه با تنوع کنترلشده است. یعنی جایی که فهم ساختار زیرین داده اهمیت دارد، نه واقعگرایی تصویری.
و فرایند آموزشش هم یکسان است: مدل الگوها را از مجموعهدادهٔ بزرگ یاد میگیرد و پارامترهای شبکه را طوری تنظیم میکند که تفاوت میان محتوای تولیدشده و محتوای واقعی کمینه شود.
ابزارها
- - فتوشاپ ادوبی — پرکردن آگاه به محتوا، برای تکمیل هوشمند تصویر.
- - اتودسک (فیوژن ۳۶۰) — طراحی مولد، برای کاوش چند تکرار طراحی بر پایهٔ قیدها.
- - GPT از اپنایآی — تولید متن و کد، طوفان فکری خلاق، و کمک به مفهوم طراحی.
- - ادوبی سنسی — یکپارچه در محصولهای ادوبی، برای خودکارکردن کارهای پیچیده.
- - رانویامال — دسترسی به مدلهای یادگیری ماشین، برای طراحانی که برنامهنویسی بلد نیستند.
- - دیپآرت — تبدیل عکس به اثر هنری با سبک هنرمندان مشهور.
- - آرتبریدر — سکوی مشارکتی ساختن و دستکاری تصویر.
- - فیگجم فیگما — از طوفان فکری تا وایرفریم.
- - و ChatGPT — تولید محتوای رابط و ایدهپردازی مفهوم طراحی.
در جریان کار طراحی
پنج کاربرد اصلیاش اینهاست: تولید ایده · نمونهسازی و آزمون · سفارشیسازی و شخصیسازی · کارایی و بهرهوری · و نوآوری در طراحی.
و اگر بخواهیم دقیقتر شویم، در هر گام تفکر طراحی کار متفاوتی میکند.
- - همدلی و پژوهش: مرتبکردن اطلاعات آشفته، خلاصهکردن یادداشت، خوشهکردن مضمونها، و پیشنویس راهنمای مصاحبه.
- - تعریف: پیشنویس صورتبندی مسئله، فهرست فرضها، فرضیهها، و سنجههای موفقیت — همراه با ارجاع به شواهد.
- - ایدهپردازی: تأمین گستره — چند رویکرد، حالتهای حاشیهای، جریانهای جایگزین، و بیش از ده راهحل با مزایا و معایب.
- - نمونهسازی: ساختن سریع گونهها — متن، حالتهای رابط، پیام خطا، ریزتعامل، قرارداد نامگذاری، و مستندسازی.
- - آزمون: بازبینی اکتشافی، فهرست وارسی حالتهای حاشیهای، تحلیل «چه چیزی میتواند خراب شود؟»، و نقشهٔ حرارتی پیشبینانه.
- - تحویل: خلاصهکردن تصمیمها، نوشتن یادداشت انتشار، مستندات پشتیبانی، و بهروزرسانی ذینفعان.
و اگر به این فهرست دقت کنید، یک الگو در آن هست: در بیشتر گامها، کار هوش مصنوعی مولد تولید گستره است، نه تولید پاسخ.
و همین، تعریف دقیقتری از نقش «کارگردان» میدهد: طراح موقعیت را صورتبندی میکند، شواهد را میدهد، خروجی مورد نظر را مشخص میکند، و نتیجه را قضاوت میکند.
محدودیتها
یک: خروجی فقط بهاندازهٔ دادهٔ آموزشی خوب است. اگر دادهٔ آموزشی محدود یا سوگیرانه یا بیکیفیت باشد، خروجی همین عیبها را بازتاب میدهد.
دو: خلاقیت و شهود واقعی ندارد. میتواند طرح تازه بسازد و نمیفهمد چه میسازد — اهمیت فرهنگی و احساسی و بافتی یک طرح را درک نمیکند.
سه: مزخرفِ باورپذیر. این عبارت دقیقترین توصیف مسئله است: هوش مصنوعی میتواند سریع و متقاعدکننده باشد، حتی وقتی اشتباه میکند.
چهار: سوگیری، در سه سطح. انسانیشناختی، سامانهای، و آماریمحاسباتی.
پنج: بافت غایب. جملهاش صریح است: «هوش مصنوعی فقط چیزی را میداند که به آن گفتهاید.» بدون قیدهای کامل و واقعیت کاربر و حالتهای حاشیهای، خروجی در خلأ ساخته میشود.
و شش: خطر اتکای بیش از حد، که میتواند به افت رشد مهارت انسانی و کمارزششدن خلاقیت انسانی برسد.
چهار وارسی کیفیت
و در برابر همین محدودیتها، چهار وارسی پیشنهاد شده که جلوی اعتماد کاذب را میگیرد.
- - ردیابیپذیری. منبعها به ورودیها یا جستوجوی وب یا دادهٔ آموزشی اشاره کنند.
- - کاملبودن بافت. مشخص کنید چه چیزی ممکن است جا افتاده باشد.
- - تفکیک داده از تفسیر. مشاهده را از عقیده برچسبگذاری کنید.
- - سوگیری و نقاط کور. حالت حاشیهای و مثال نقض و دیدگاه جایگزین بخواهید.
و وارسی سوم عملیترینشان است. خروجی هوش مصنوعی معمولاً مشاهده و تفسیر را در یک جمله به هم میچسباند — «کاربران در این مرحله گیج میشوند» هم ادعای واقعیت است و هم قضاوت، و جداکردنشان کار شماست.
کپیرایت و نویسندگی
دو مسئلهٔ حقوقی جدی اینجا هست.
یک: طرح تولیدشده ممکن است ناخواسته عناصری را بازتولید کند که حق نشر دارند، و همین میتواند به مسئلهٔ حقوقی ختم شود.
دو: اصالت این طرحها از دادهٔ آموزشی میآید. خروجی، سبکها و الگوها و عناصر موجود را بازترکیب و بازتفسیر میکند تا چیز تازهای بسازد.
و یک نمونهٔ اخلاقی هم هست که راه سومی نشان میدهد. پروژهٔ «بینظارت» از رفیق آنادول با مدل StyleGAN2 ADA و مجموعهدادهٔ موزهٔ هنر مدرن نیویورک ساخته شد. و مدل نویسندگی مشترکش، در فضای مبهم حق نشر هنر تولیدشده با هوش مصنوعی روشنی میدهد.
و برای استانداردهای اخلاقی، دو مرجع نام برده میشود: راهنمای HAX مایکروسافت برای ساختن تجربههای قابلاعتماد، و هفت ویژگی سیستم قابلاعتماد از انآیاستی که در هوش عمومی مصنوعی شرحشان دادم.
یک قاعده برای استفاده
این بخش افزودهٔ من است، چون فهرست محدودیتها بهتنهایی به کسی نمیگوید کِی استفاده کند و کِی نه.
و قاعدهاش به دو پرسش برمیگردد: «اگر این خروجی غلط باشد، چقدر طول میکشد تا بفهمم؟» و «هزینهٔ نفهمیدنش چقدر است؟»
و از ترکیبشان سه ناحیه درمیآید.
ناحیهٔ امن: غلطبودن فوراً معلوم میشود و هزینهاش کم است. تولید بیست گونهٔ متن دکمه، نامگذاری، یا فهرست حالتهای حاشیهای. اینجا هوش مصنوعی مولد بیرقیب است.
ناحیهٔ مراقبت: غلطبودن دیر معلوم میشود ولی هزینهاش قابلجبران است. خلاصهٔ پژوهش، صورتبندی مسئله، تحلیل رقبا. اینجا هر ادعا باید به منبع وصل شود.
ناحیهٔ ممنوع: غلطبودن دیر معلوم میشود و هزینهاش بالاست. عدد در گزارش مدیریتی، ادعای حقوقی، توصیهٔ پزشکی، یا هر چیزی که کاربر بر پایهٔ آن تصمیم مالی بگیرد.
و همانطور که در تفکر واگرا نوشتم، یک هشدار دیگر هم هست: دیدن خروجی هوش مصنوعی پیش از فکرکردن خودتان، تثبیت میسازد. پس ترتیب درست این است که اول خودتان چند ایده بنویسید، بعد از مدل گستره بخواهید.
در بافت فارسی
یک: خروجی فارسی کیفیت پایینتری دارد، ولی مشکل اصلی این نیست. مشکل این است که کیفیت پایینتر به همان اندازه مطمئن ارائه میشود.
و نتیجهاش این است که ناحیهٔ «مراقبت» در فارسی بزرگتر از انگلیسی است. چیزی که در انگلیسی امن بود، اینجا وارسی میخواهد.
دو: متن تولیدشده لحن ترجمهای دارد. جملههای بلند، ساختار انگلیسی، و واژههای اداری. برای کاربر فارسیزبان، این متن بلافاصله «ماشینی» خوانده میشود.
و درمانش ویرایش نیست؛ بازنویسی است. استفاده از خروجی بهعنوان پیشنویس معنا دارد و استفاده از آن بهعنوان متن نهایی، تقریباً همیشه معلوم میشود.
سه: ارقام و تاریخ در خروجی قاطی میشوند. مدل بهراحتی رقم لاتین و فارسی را مخلوط میکند و تاریخ میلادی را بهجای شمسی میآورد.
پس اگر خروجی مستقیم وارد محصول میشود، یک لایهٔ نرمالسازی بگذارید — همان که در قالب بخشنده برای ورودی کاربر گفتم، اینجا برای خروجی مدل لازم است.
چهار: دادهٔ آموزشی فارسی، سوگیریهای خودش را دارد. بخش بزرگی از متن فارسی اینترنت رسمی و خبری و اداری است، و لحن محاوره و تجربهٔ روزمره کمتر در آن دیده میشود.
و بههمین دلیل، برای متن رابط کاربری — که باید کوتاه و محاورهای باشد — خروجی مدل معمولاً از جای اشتباهی میآید. نمونه دادن اینجا بیشتر از دستوردادن جواب میگیرد.
پنج: مسئلهٔ کپیرایت اینجا کمتر پیگیری میشود، و همین آن را خطرناکتر میکند. نبودِ پیگرد قانونی بهمعنای نبودِ مسئولیت نیست — و اگر محصولی روزی بیرون از ایران عرضه شود، این بدهی همراهش میرود.
جمعبندی
- - هوش مصنوعی مولد محتوا را خودمختار تولید میکند، با یادگرفتن الگو از مجموعهدادهٔ عظیم · و برخلاف هوش مصنوعی سنتی که از قاعده پیروی میکند، خروجی تازه میسازد
- - دو مدل اصلی: شبکههای مولد تخاصمی از ۲۰۱۴ برای تصویر فوقواقعگرایانه · و خودرمزگذارهای وردشی از ۲۰۱۳ برای نویزدایی و تنوع کنترلشده
- - پنج کاربرد: تولید ایده · نمونهسازی و آزمون · شخصیسازی · کارایی · نوآوری — و در همهٔ گامهای تفکر طراحی جای مشخصی دارد
- - الگوی مشترک: کارش تولید گستره است، نه تولید پاسخ · و نقش طراح از سازنده به کارگردان تغییر میکند
- - شش محدودیت: کیفیت دادهٔ آموزشی · نبودِ خلاقیت و شهود واقعی · مزخرفِ باورپذیر · سوگیری در سه سطح · بافت غایب · و خطر اتکای بیش از حد
- - چهار وارسی: ردیابیپذیری · کاملبودن بافت · تفکیک داده از تفسیر · و پرسیدن سوگیری و نقاط کور
- - کپیرایت: بازتولید ناخواستهٔ عناصر دارای حق نشر · و اصالتی که از دادهٔ آموزشی میآید · با نمونهٔ نویسندگی مشترک در پروژهٔ «بینظارت» رفیق آنادول
- - قاعدهٔ استفاده: اگر غلط باشد چقدر طول میکشد بفهمم، و هزینهاش چقدر است · سه ناحیهٔ امن و مراقبت و ممنوع
- - و در فارسی: ناحیهٔ مراقبت بزرگتر است · لحن ترجمهای بازنویسی میخواهد نه ویرایش · خروجی نرمالسازی لازم دارد · دادهٔ فارسی به رسمی و اداری سوگیری دارد · و بیپیگردبودن کپیرایت، بدهی را حذف نمیکند
منبع
این نوشته «بازنویسی آزاد» است از مطلب What is Generative AI? در وبسایت بنیاد طراحی تعامل (Interaction Design Foundation — IxDF؛ بدون نام نویسندهٔ مشخص). مفاهیم پایه — تعریف هوش مصنوعی مولد و تفاوتش با هوش مصنوعی سنتی و نقش پرامپت، پایهٔ شبکههای عصبی، هر دو مدل مولد یعنی شبکههای مولد تخاصمی با سال ۲۰۱۴ و ساختار مولد و تمیزدهنده و کاربردهایش، و خودرمزگذارهای وردشی با سال ۲۰۱۳ و ساختار رمزگذار و رمزگشا و کاربردهایش، فرایند آموزش و کمینهکردن تفاوت میان محتوای تولیدشده و واقعی، فهرست کامل ابزارها از فتوشاپ و فیوژن ۳۶۰ و GPT و سنسی و رانویامال و دیپآرت و آرتبریدر و فیگجم و ChatGPT، پنج کاربرد اصلی، کاربرد در هر گام تفکر طراحی از همدلی تا تحویل، گزارهٔ تغییر نقش طراح از سازنده به کارگردان و چهار وظیفهاش، همهٔ محدودیتها شامل وابستگی به کیفیت دادهٔ آموزشی و نبودِ خلاقیت و شهود واقعی و مزخرفِ باورپذیر و سه سطح سوگیری و بافت غایب و خطر اتکای بیش از حد، هر چهار وارسی کیفیت، هر دو مسئلهٔ کپیرایت، پروژهٔ «بینظارت» از رفیق آنادول با مدل StyleGAN2 ADA و مجموعهدادهٔ موزهٔ هنر مدرن و مدل نویسندگی مشترک، و ارجاع به راهنمای HAX مایکروسافت و هفت ویژگی انآیاستی — از این منبع گرفته شده. متن فارسی، ساختار بخشها و همهٔ تحلیلها کاملاً مستقل نوشته شدهاند.
متن مطلب اصلی تحت هیچ لایسنس بازی منتشر نشده است؛ به همین دلیل اینجا ترجمهٔ کلمهبهکلمه ارائه نشده و متن کامل انگلیسی (بههمراه همهٔ منابع مرتبط) در لینک زیر در دسترس است.
بخشهای افزودهٔ مترجم: صورتبندی آغازین با تفاوت تحلیل و ساخت؛ استخراج الگوی مشترک فهرست کاربردها یعنی «تولید گستره نه تولید پاسخ» و پیوندش با نقش کارگردان؛ برجستهکردن وارسی سوم و توضیح اینکه خروجی معمولاً مشاهده و تفسیر را در یک جمله میچسباند؛ کل بخش «یک قاعده برای استفاده» شامل دو پرسش زمانکشف و هزینه، سه ناحیهٔ امن و مراقبت و ممنوع با نمونههای هر کدام، و هشدار تثبیت از راه دیدن خروجی پیش از فکرکردن خود طراح؛ و کل بخش بافت فارسی شامل بزرگتر بودن ناحیهٔ مراقبت بهدلیل ارائهٔ مطمئنِ کیفیت پایینتر، لحن ترجمهای متن فارسی و لزوم بازنویسی بهجای ویرایش، قاطیشدن ارقام و تاریخ و لزوم لایهٔ نرمالسازی روی خروجی، سوگیری دادهٔ فارسی به سمت متن رسمی و اداری و پیامدش برای متن رابط کاربری، و خطرناکتر بودن مسئلهٔ کپیرایت بهدلیل کمپیگیریبودنش
تصاویر: هیچ تصویری از مطلب اصلی بازتولید نشده است. هر سه نمودار این صفحه طراحی مستقل مترجم است.
مشاهدهٔ مطلب اصلی
هوش مصنوعی مولد