تحلیل چندمتغیره (Multivariate Analysis) چیست؟
💡 این متن «بازنویسی آزاد» است: ایدهها و مفاهیم مطلب اصلی با نگارش کاملاً مستقل فارسی و مثالهای تازه بازگو شدهاند و ترجمهٔ کلمهبهکلمه نیست. بخشهای افزودهٔ مترجم در جعبهٔ منبع مشخص شدهاند. ترجمه و بازنویسی این متن با کمک هوش مصنوعی انجام شده است.
صفحهٔ مقایسهٔ گوشی در یک فروشگاه اینترنتی را باز کنید. سه گوشی کنار هماند و زیر هر کدام چهل ردیف مشخصات. قیمت، باتری، وزن، حافظه، دوربین جلو، دوربین پشت، و همینطور تا آخر. همهٔ اطلاعات آنجاست. ولی بعد از ده ردیف، دیگر یادتان نیست گوشی اول در باتری بهتر بود یا دومی.
مشکل کمبود داده نیست. مشکل این است که ذهن ما نمیتواند همزمان ده عدد را برای سه چیز در خودش نگه دارد. این مقاله دربارهٔ روشهایی است که این کار را به چشم میسپارند.
تحلیل چندمتغیره چیست؟
تحلیل چندمتغیره (Multivariate Analysis) یعنی بررسی همزمان چند متغیر وابسته در برابر یک یا چند متغیر مستقل. منبع مرز را روی چهار متغیر وابسته یا بیشتر میگذارد. در مثال فروشگاه، مدل گوشی متغیر مستقل است و هر ردیف مشخصات یک متغیر وابسته.
منبع مثال خرید لپتاپ را میآورد و نکتهٔ خوبی دارد: ما همه هر روز تحلیل چندمتغیره میکنیم، فقط اسمش را نمیدانیم. خرید خودرو، انتخاب اجارهخانه و مقایسهٔ دو پیشنهاد کاری همه از همین جنساند.
کار طراح مصورسازی اطلاعات اینجا روشن است. باید این روابط پیچیده را طوری نشان دهد که کاربر بتواند دربارهشان تصمیم بگیرد. با یک متغیر، این کار ساده است. با هر متغیر اضافه، سختتر میشود.
چرا بعد از سه بعد جا کم میآید
منبع مشکل را اینطور توضیح میدهد. بهطور سنتی، هر متغیر یک بعد یا یک محور میگیرد. تحلیل تکمتغیره روی یک خط انجام میشود، دومتغیره روی صفحه و سهمتغیره در فضای سهبعدی. آدمها سه بعد را خوب درک میکنند. ولی بعد چهارم و پنجم وجود ندارد.
من یک قدم جلوتر میروم: حتی بعد سوم هم روی صفحهٔ نمایش ارزان نیست. نمودار سهبعدی روی صفحهٔ تخت یعنی عمق را باید از روی پرسپکتیو حدس زد. نقطهها پشت هم پنهان میشوند. بدون چرخاندن نمودار، نمیشود فهمید کدام نقطه جلوتر است.
ویلیام کلیولند و رابرت مکگیل در سال ۱۹۸۴ آزمایشی دربارهٔ دقت خواندن نمودارها انجام دادند. آنها نشان دادند که آدمها جایگاه روی یک محور مشترک را از همه دقیقتر میخوانند. بعد از آن طول، بعد زاویه و شیب، و بعد مساحت. حجم و شدت رنگ ته فهرستاند.
این فهرست برای تحلیل چندمتغیره یک پیام دارد. وقتی بعدهای فضایی تمام شدند، هر متغیر اضافه باید با یکی از این کانالهای کمدقتتر نشان داده شود. همان چیزی که در ویژگیهای بصری پیشتوجهی هم دیدیم: همهٔ نشانههای بصری به یک اندازه سریع و دقیق خوانده نمیشوند.
منبع سه خانوادهٔ راهحل را معرفی میکند: نمایشهای هندسی، نمایشهای نمادین و نمایشهای پیکسلی.
نمایشهای هندسی
در این خانواده، داده به یک فضای هندسی نگاشته میشود. منبع سه روش را نام میبرد.
مختصات موازی. بهجای محورهای عمود بر هم، همهٔ محورها موازی و با فاصلهٔ برابر کنار هم مینشینند. هر رکورد یک خط شکسته است که مقدارش روی هر محور را به محور بعد وصل میکند. این روش را آلفرد اینسلبرگ در دههٔ ۱۹۸۰ رایج کرد.
نمودار بالای صفحه پنج گوشی را روی پنج محور نشان میدهد. گوشی «ج» در هیچ ویژگی اول نیست، ولی در هیچکدام هم ته جدول نمیافتد. این را فقط شکل خطش نشان میدهد، یعنی خطی که هیچجا به لبهها نزدیک نمیشود. در جدول مشخصات، همین نکته بعد از چند دقیقه خواندن پیدا میشد.
منبع دو نکته دربارهٔ این روش دارد. برای دادههای کوچک بهتر کار میکند، چون با خطهای زیاد فاصلهٔ بینشان گم میشود. و ابزارهایی که اجازه میدهند کاربر ترتیب محورها را عوض کند، کمک میکنند رابطهٔ دو متغیر کنار هم راحتتر دیده شود.
ماتریس نمودارهای پراکندگی. برای هر جفت متغیر یک نمودار پراکندگی کوچک کشیده میشود و همه در یک ماتریس کنار هم قرار میگیرند. مقایسهٔ سریع را آسان میکند، چون نمودارها در ردیف و ستون همترازند. ولی به گفتهٔ منبع دو ایراد دارد. برچسب زدن محورهای نمودارهای کوچک تقریباً ناممکن است، و هیچ نمای کلی از داده نمیدهد.
جدول میلهای. این روش را رامانا رائو و همکارانش در زیراکس پارک ساختند. شکلش شبیه صفحهگسترده است، ولی بهجای عدد، هر خانه یک میلهٔ افقی متناسب با مقدارش دارد. کاربر میتواند ستونها را جابهجا و پنهان کند یا داده را بر اساس هر ستون مرتب کند.
نمایشهای نمادین
خانوادهٔ دوم هر رکورد را با یک شکل یا نماد نشان میدهد که ویژگیهایش، مثل رنگ و اندازه و جهت، با متغیرها تغییر میکنند.
نمودار ستارهای. متغیرها روی محورهایی نشستهاند که از یک مرکز بیرون میزنند، و نقطههای روی محورها به هم وصل میشوند تا یک چندضلعی بسازند. برای مقایسهٔ چند رکورد انگشتشمار خوب است. نمودار زیر همان داده را با این روش و با جدول میلهای کنار هم نشان میدهد.
این مقایسه یک ضعف نمودار ستارهای را نشان میدهد. چشم مساحت چندضلعی را میبیند و «الف» بزرگترین است. ولی مساحت به ترتیب محورها بستگی دارد. دو مقدار بزرگ کنار هم مساحت بیشتری میسازند تا همان دو مقدار با فاصله از هم. جدول میلهای نشان میدهد که این بزرگی بیشتر از قیمت و حافظه آمده، و قیمت بالا اصلاً خوب نیست.
چهرههای چرنوف. هرمان چرنوف، آماردان آمریکایی، در سال ۱۹۷۳ پیشنهاد کرد هر متغیر را به یک جزء چهره نگاشت کنیم: اندازهٔ چشم، انحنای دهان، طول بینی. منطقش این بود که آدمها در دیدن تفاوت چهرهها استادند. منبع مثال قاضیهای آمریکایی را میآورد و خودش هم نقد اصلی را میگوید. آدمها دو چهره را بر اساس یک جزء، مثلاً لبخند، شبیه هم میبینند و بقیهٔ داده را نادیده میگیرند. من یک ایراد دیگر هم اضافه میکنم: چهره بار عاطفی دارد. رکوردی که دهانش پایین افتاده، «غمگین» دیده میشود، حتی اگر فقط یک عدد در آن کم باشد.
نمایشهای پیکسلی
خانوادهٔ سوم از کوچکترین واحد صفحه استفاده میکند. هر مقدار یک پیکسل رنگی است، و این یعنی میشود میلیونها مقدار را روی یک صفحه نشان داد.
منبع پنج پرسش را از دنیل کایم، دانشمند رایانهٔ آلمانی، میآورد که پیش از ساختن چنین نمایشی باید جواب داده شوند. شکل پنجرهای که پیکسلها در آن مینشینند چیست؟ هر پیکسل چه چیزی را نشان میدهد؟ پیکسلها در پنجره چطور چیده میشوند؟ کدام نگاشت رنگ به کار میرود؟ و پنجرههای مختلف به چه ترتیبی کنار هم قرار میگیرند؟
این روش همیشه با نرمافزار ساخته میشود. برای طراح محصول کمتر پیش میآید، ولی نمونههای آشنا دارد. نقشهٔ مشارکت روزانه در گیتهاب، یعنی آن مربعهای سبز کوچک، یک نمایش پیکسلی ساده از یک سال فعالیت است.
کدام نمایش برای کدام کار
این بخش افزودهٔ من است. منبع روشها را معرفی میکند ولی نمیگوید کِی کدام را انتخاب کنیم. به نظرم انتخاب از کاری شروع میشود که کاربر میخواهد انجام دهد، نه از داده.
مقایسهٔ چند گزینهٔ معدود، مثل خرید گوشی بین سه مدل. جدول میلهای بهترین است، چون مقدارها روی یک خط مشترک خوانده میشوند. نمودار ستارهای برای دیدن «شخصیت» کلی خوب است، به شرطی که ترتیب محورها ثابت و معنادار باشد.
پیدا کردن رابطه بین متغیرها، مثل اینکه آیا گوشیهای سنگینتر باتری بهتری دارند. ماتریس نمودارهای پراکندگی، چون هر جفت را جدا نشان میدهد.
پیدا کردن الگو در صدها رکورد، مثل اینکه کدام گروه از کاربران رفتار مشابهی دارند. مختصات موازی، به شرطی که کاربر بتواند یک بازه را روی یک محور انتخاب کند و فقط خطهای آن بازه پررنگ شوند.
دیدن کلیت در میلیونها مقدار. نمایش پیکسلی.
دو ابزار دیگر هم هستند که در هر چهار حالت کمک میکنند. اولی چندتاییهای کوچک است، که ادوارد تافتی رایجش کرد. یک نمودار ساده چند بار با همان محورها برای گروههای مختلف تکرار میشود. دومی تعامل است. بن اشنایدرمن در سال ۱۹۹۶ قاعدهای را خلاصه کرد که هنوز بهترین راهنماست: اول نمای کلی، بعد بزرگنمایی و فیلتر، و جزئیات فقط وقتی کاربر خواست. هیچ نمایش ثابتی بهتنهایی ده متغیر را حل نمیکند. نمایشی که کاربر بتواند در آن بگردد، معمولاً حل میکند.
چهار خطای رایج
این بخش هم افزودهٔ من است. اینها خطاهاییاند که در نمودارهای چندمتغیرهٔ محصولات واقعی بارها دیدهام، و منبع به آنها نمیپردازد.
جهت محورها یکی نیست. در مختصات موازی، روی محور باتری «بالاتر» یعنی بهتر. روی محور قیمت و وزن، «بالاتر» یعنی بدتر. اگر این را روشن نکنید، خطی که همهجا بالاست به نظر بهترین گزینه میآید، در حالی که گرانترین و سنگینترین هم هست. یا محورهای «کمتر بهتر است» را وارونه کنید، یا روی هر محور بنویسید کدام سمت بهتر است.
مقیاس هر محور پنهان است. هر محور معمولاً از کمترین تا بیشترین مقدار همان داده کشیده میشود. یعنی فاصلهٔ یک سانتیمتری روی محور وزن شاید ده گرم باشد و روی محور قیمت ده میلیون تومان. اگر کاربر این را نداند، تفاوتهای کوچک را بزرگ میبیند. کمینه و بیشینهٔ هر محور را کنارش بنویسید.
رنگ برای همهچیز. وقتی بعدها تمام میشوند، وسوسه این است که هر متغیر اضافه را با یک رنگ نشان دهیم. ولی بر اساس همان فهرست کلیولند و مکگیل، شدت رنگ از کمدقتترین کانالهاست. رنگ را برای یک کار نگه دارید، مثلاً پررنگ کردن گزینهای که کاربر انتخاب کرده.
مقدار گمشده صفر نیست. اگر یک گوشی اطلاعات وزن ندارد، کشیدن خطش تا پایین محور یعنی ادعای اینکه سبکترین است. مقدار گمشده را با شکاف در خط یا نشانهای جدا نشان دهید، نه با صفر.
در بافت فارسی
نمودارهای چندمتغیره پر از برچسب، عدد و محورند. هر سه در رابط فارسی جزئیات خودشان را دارند.
یک: ترتیب محورها در راستبهچپ. در مختصات موازی و جدول میلهای، چشم فارسیخوان از راست شروع میکند. مهمترین متغیر، معمولاً قیمت، را روی محور راست بگذارید. کتابخانههای نمودار معمولاً محور اول را سمت چپ میگذارند و این را باید دستی برگرداند.
دو: رقم فارسی روی محور. نموداری که عنوانش فارسی است و عددهای محورش لاتین، نیمهکاره به نظر میرسد. برچسب محورها، راهنما و راهنمای ابزار را یکدست کنید. جداکنندهٔ هزارگان را هم فراموش نکنید. «۱٬۲۵۰٬۰۰۰» از «۱۲۵۰۰۰۰» خیلی سریعتر خوانده میشود.
سه: برچسبهای بلند فارسی. در ماتریس نمودارهای پراکندگی، هر نمودار کوچک جای کمی برای برچسب دارد. «ظرفیت باتری بر حسب میلیآمپر ساعت» جا نمیشود. نام کوتاه و ثابتی مثل «باتری» انتخاب کنید و واحد را یک بار در راهنما بگویید.
چهار: جدول مشخصات فروشگاهها. صفحهٔ مقایسهٔ کالا در بیشتر فروشگاههای اینترنتی ایرانی جدولی از متن و عدد است. تبدیل فقط ستونهای عددی به میلههای کوچک، مثل جدول میلهای، تفاوتها را دیدنی میکند، نه خواندنی. ردیفهایی که بین همهٔ گزینهها یکساناند را هم میشود پنهان کرد.
پنج: قیمت در تورم. در بازاری که قیمتها هر ماه عوض میشوند، قیمت متغیری ناپایدار است. نمودار مقایسهای که تاریخ ندارد، دو ماه بعد گمراهکننده است. کنار هر متغیری که با زمان تغییر میکند، تاریخ داده را بنویسید.
جمعبندی
تحلیل چندمتغیره یعنی بررسی همزمان چهار متغیر یا بیشتر. سختیاش برای طراح این است که بعدهای فضایی زود تمام میشوند و بقیهٔ کانالهای بصری کمدقتترند.
منبع سه خانواده راهحل میدهد. نمایشهای هندسی، مثل مختصات موازی و ماتریس نمودارهای پراکندگی و جدول میلهای. نمایشهای نمادین، مثل نمودار ستارهای و چهرههای چرنوف. و نمایشهای پیکسلی. انتخاب بینشان از کار کاربر شروع میشود، و تعامل تقریباً همیشه از انتخاب نمایش مهمتر است.
اگر بخواهم یک پرسش بگذارم: در محصول شما، کاربر کجا مجبور است چند عدد را در ذهنش نگه دارد تا تصمیم بگیرد، و اگر آن عددها میله بودند، چه عوض میشد؟
منبع
این نوشته «بازنویسی آزاد» است از موضوع What is Multivariate Analysis? و مقالهٔ اصلی آن، Information Visualization – An Introduction to Multivariate Analysis، منتشرشده در وبسایت بنیاد طراحی تعامل (Interaction Design Foundation — IxDF؛ بدون نام نویسندهٔ مشخص). مفاهیم پایهٔ برگرفته از این منبع — تعریف تحلیل چندمتغیره با چهار متغیر وابسته یا بیشتر، نبود بعد چهارم بهعنوان مسئلهٔ طراح، مثال خرید لپتاپ و خودرو و گوشی، سه خانوادهٔ نمایش هندسی و نمادین و پیکسلی، مختصات موازی و مناسب بودنش برای دادههای کوچک و جابهجایی محورها، ماتریس نمودارهای پراکندگی و دو ایرادش، جدول میلهای، نمودار ستارهای، چهرههای چرنوف با مثال قاضیها و نقد آن، و پنج پرسش دنیل کایم برای نمایش پیکسلی — از این منبع گرفته شده، اما متن فارسی و توضیحها کاملاً مستقل نوشته شدهاند.
متن مقالهٔ اصلی تحت هیچ لایسنس بازی منتشر نشده است؛ به همین دلیل اینجا ترجمهٔ کلمهبهکلمه ارائه نشده و متن کامل انگلیسی (بههمراه همهٔ تصاویر) در لینک زیر در دسترس است.
ارجاعهای بیرونی: رتبهبندی دقت خواندن نشانههای بصری از ویلیام کلیولند و رابرت مکگیل، Graphical Perception (۱۹۸۴)؛ مختصات موازی از آلفرد اینسلبرگ (دههٔ ۱۹۸۰)؛ چهرههای چرنوف از هرمان چرنوف (۱۹۷۳)؛ جدول میلهای از رامانا رائو و همکاران در زیراکس پارک؛ چندتاییهای کوچک از ادوارد تافتی؛ و قاعدهٔ نمای کلی و فیلتر و جزئیات از بن اشنایدرمن، The Eyes Have It (۱۹۹۶).
بخشهای افزودهٔ مترجم: بند آغازین دربارهٔ صفحهٔ مقایسهٔ گوشی؛ هزینهٔ بعد سوم روی صفحهٔ تخت و پژوهش کلیولند و مکگیل؛ مثال پنج گوشی در مختصات موازی و نمودار آن؛ اینسلبرگ؛ نمودار «یک داده، دو چهره» و وابستگی مساحت ستاره به ترتیب محورها؛ بار عاطفی چهرههای چرنوف؛ نقشهٔ مشارکت گیتهاب بهعنوان نمایش پیکسلی؛ کل بخش «کدام نمایش برای کدام کار» شامل انتخاب بر اساس کار کاربر، چندتاییهای کوچک تافتی و قاعدهٔ اشنایدرمن؛ کل بخش «چهار خطای رایج» شامل جهت محورها، مقیاس پنهان، استفادهٔ بیش از حد از رنگ و مقدار گمشده؛ و کل بخش «در بافت فارسی» شامل ترتیب محورها در راستبهچپ، رقم فارسی و جداکنندهٔ هزارگان، برچسبهای بلند، جدول مشخصات فروشگاهها، و قیمت در تورم.
تصاویر: تصویرهای مطلب منبع با لایسنسهای CC BY-SA 3.0 و CC BY-SA 4.0 و مالکیت عمومی آمدهاند و تصویر اصلی مطلب با لایسنس CC BY-NC 2.0 است؛ هیچکدام اینجا بازتولید نشدهاند. هر سه نمودار این صفحه طراحی اختصاصی مترجم است.
مشاهدهٔ مقالهٔ اصلی
تحلیل چندمتغیره