رابط چندوجهی (Multimodal Interface) چیست؟
💡 این متن «بازنویسی آزاد» است: ایدهها و مفاهیم مطلب اصلی با نگارش کاملاً مستقل فارسی و مثالهای تازه بازگو شدهاند و ترجمهٔ کلمهبهکلمه نیست. بخشهای افزودهٔ مترجم در جعبهٔ منبع مشخص شدهاند.
در حال رانندگی هستید و مسیریاب میگوید «سیصد متر دیگر به راست بپیچید». همزمان روی صفحه یک فلش بزرگ ظاهر میشود.
شما به صفحه نگاه نمیکنید، ولی اگر صدا را نشنیده باشید، یک نگاه کوتاه کافی است. این دو کانال یک پیام را با دو زبان میگویند، و همین است که مسیریاب را قابل اعتماد میکند.
حالا تصور کنید صدا بگوید «راست» و فلش به چپ اشاره کند. آن لحظه، بدترین رابطی است که میشود ساخت.
رابط چندوجهی چیست؟
رابط چندوجهی رابطی است که از بیش از یک کانال حسی برای گرفتن ورودی یا دادن خروجی استفاده میکند. صدا، لمس، حرکت دست، نگاه، لرزش و حتی گرما، هر کدام یک «وجه» حساب میشوند.
به این معنا، تقریباً هر گوشی امروزی چندوجهی است. ولی داشتن چند کانال با طراحی چندوجهی یکی نیست.
بیشتر اپها هنوز یک رابط گرافیکیاند که اینجا و آنجا یک بوق یا یک لرزش کوتاه به آن چسبیده است. آن بوق طراحی نشده؛ فقط اضافه شده است.
نکتهٔ اصلی منبع همینجاست. نباید فرض کنید بلدید تعامل چندوجهی را درست تحویل دهید، فقط چون هر روز با بوقها و لرزشهای اپهای دیگر زندگی میکنید.
هر کانال باید با هدف مشخص محصول، توانایی کاربر و موقعیتی که در آن است انتخاب شود. و این انتخاب را فقط آزمودن با کاربر واقعی تأیید میکند.
هر کدام از این وجهها در این مجموعه مقالهٔ خودش را دارد: رابط صوتی، تعامل مبتنی بر حرکت، رابط لمسیبازخوردی و ردیابی چشم. موضوع این مقاله خود وجهها نیست، نسبت میان آنهاست.
«بگذارش آنجا»: جایی که ماجرا شروع شد
در سال ۱۹۸۰، Richard Bolt در MIT نمونهای ساخت که هنوز مرجع این حوزه است. اسمش را از جملهای گرفت که کاربر به آن میگفت: Put That There.
کاربر روی صندلی جلوی یک دیوار نمایش بزرگ مینشست. به یک شکل اشاره میکرد و میگفت «آن را»، بعد به نقطهٔ دیگری اشاره میکرد و میگفت «بگذار آنجا».
هیچکدام از دو کانال بهتنهایی معنا نداشت. جملهٔ «بگذارش آنجا» بدون اشاره، نمیگوید چه چیزی و کجا. اشاره هم بدون جمله، نمیگوید چه کاری.
این همان بینش پایه است. صدا برای گفتنِ چه کاری خوب است و اشاره برای گفتنِ کجا. هر وجه نیمی از فرمان را میبرد که در آن بهتر است.
چهار نسبت میان دو وجه
پانزده سال بعد، Joëlle Coutaz و همکارانش این نسبتها را در چهار دسته نامگذاری کردند. نمودار بالای صفحه همین چهار دسته را نشان میدهد:
- - مکمل: هر وجه بخشی از پیام را میبرد و معنا از ترکیبشان ساخته میشود. همان «بگذارش آنجا».
- - اختصاصی: یک کار فقط از یک وجه انجام میشود. مثلاً رمز را فقط تایپ میکنید و هرگز بلند نمیگویید.
- - تکراری: هر دو وجه همان پیام را همزمان میبرند. صدای مسیریاب و فلش روی صفحه.
- - همارز: هر کدام بهتنهایی کافی است و کاربر انتخاب میکند. جستوجو را هم میشود تایپ کرد، هم گفت.
این دستهبندی فقط یک واژهنامه نیست، چون هر نسبت یک خطر متفاوت دارد.
نسبت مکمل قویترین است، ولی شکنندهترین هم هست. اگر یکی از دو نیمه گم شود، کل فرمان از دست میرود.
نسبت تکراری امن است، ولی میتواند آزاردهنده شود. کاربری که صفحه را دیده، شنیدن دوبارهٔ همان پیام را اضافهگویی میداند.
نسبت همارز از همه به دسترسپذیری نزدیکتر است. کسی که نمیتواند حرف بزند تایپ میکند، و کسی که نمیتواند تایپ کند حرف میزند.
برای کاربرانی که با فناوری کمکی کار میکنند، این نسبت یک امتیاز اضافه نیست. تنها راه ورود است.
یک تمایز مهندسی هم اینجا هست. ادغام یعنی سیستم دو ورودی را کنار هم میگذارد تا یک معنا بسازد. جایگزینی یعنی اگر یک کانال شکست خورد، سراغ دیگری میرود.
اولی در زمان اتفاق میافتد و به همزمانی حساس است. اشارهای که یک ثانیه دیرتر از «آنجا» برسد، ممکن است به نقطهٔ غلطی وصل شود. دومی به طراحی مسیر برگشت نیاز دارد، و این مسیر معمولاً فراموش میشود.
خروجی: کانال را بافت انتخاب میکند
تمرکز منبع روی خروجی است، نه ورودی. استدلالش این است که رابط گرافیکی تمام توجه کاربر را میخواهد، در حالی که بیشتر اطلاعاتی که لازم داریم کوتاه است.
یک پیشنهاد رستوران، شمارهٔ تلفن یک نفر، یا پیشبینی هوای عصر، اینها چند کلمهاند. برای گرفتنشان نباید گوشی را از جیب درآورد و در یک اپ گشت.
این همان ایدهٔ رایانش آرام است: اطلاعات باید در حاشیهٔ توجه بماند، نه در مرکز آن. و وجههای غیردیداری ابزار اصلی رسیدن به آن حاشیهاند.
هزینهٔ نگاه مداوم به صفحه هم فقط وقت نیست. پژوهشهایی که منبع به آنها اشاره میکند نشان دادند کسی که با نقشهٔ گوشی در شهر راه میرود، تصویر ذهنی ضعیفتری از محیط میسازد.
چنین کسی نشانههای مهم را کمتر میبیند و فقط مسیر بین دو نقطه را یاد میگیرد. در مقابل، کسی که نقشهٔ کاغذی داشت، تصویر کاملتری از کل محدوده ساخت.
منبع چند نمونهٔ پژوهشی برای جایگزین کردن صفحه میآورد، که هر کدام یک ایدهٔ قابل استفاده دارد:
- - موسیقی بهجای فلش: صدای موسیقی در هدفون از سمتِ مقصد میآید و هرچه دورتر باشید آرامتر میشود.
- - صدای قدمها: صدای گامهای یک نفر از جهت نزدیکترین تکهٔ مسیر پخش میشود. صدایی که در خیابان غریبه نیست و حواس را پرت نمیکند.
- - صدای آب: شدت جریان آب نشان میدهد در آن محله چقدر دربارهٔ چیزی حرف زده میشود، و هر پیام تازه مثل سنگی در آن میافتد.
- - لرزشی که بزرگ میشود: یک لرزش تقریباً نامحسوس که با هر تماس از دست رفته کمی قویتر و تندتر میشود.
- - گرما: صفحهای که گرم یا سرد میشود تا بگوید پیام تازه کاری است یا شخصی، و چقدر مهم است.
وجه مشترک همهٔ اینها یک چیز است. کاربر وضعیت یک کار جاری را دنبال میکند، بیآنکه برای هر بهروزرسانی به صفحه نگاه کند.
منبع هم نتیجه میگیرد که رویکرد غیردیداری بیشترین کارایی را همینجا دارد: پیگیری کارهای در جریان و خبرهای مهمی که تازه رسیدهاند.
ولی انتخاب کانال ثابت نیست. در خیابان پرسروصدا، گفتار مصنوعی شنیده نمیشود و یک پیام روی صفحه بهتر است. در جلسه، لرزش از صدا بهتر است. در رانندگی، صدا از صفحه بهتر است.
یعنی یک پیام واحد در سه موقعیت، سه کانال متفاوت لازم دارد. تشخیص اینکه الان کدام موقعیت است، کار آگاهی از بافت است.
منبع دربارهٔ لرزش هشداری هم دارد. یک اپ که با لرزش خبر میدهد قابل تحمل است. پنج اپ که هر کدام همین کار را میکنند، گوشی را به یک مزاحم دائمی تبدیل میکنند.
کانالهای غیردیداری هم منبع محدودیاند و همهٔ اپها از یک انبار برمیدارند.
وقتی وجهها خطا را ضرب میکنند
این بخش در منبع نیست، ولی به نظر من جایی است که بیشتر محصولات چندوجهی واقعاً شکست میخورند.
منبع فقط اشاره میکند که سیستم باید بفهمد کاربر گوشی را عمداً تکان داده یا تصادفی. این سؤال کوچک، دری به یک مسئلهٔ بزرگتر است: هر وجه تازه، یک حدس تازه است.
صفحهٔ لمسی تقریباً هرگز اشتباه نمیکند. ولی تشخیص گفتار، تشخیص حرکت و ردیابی نگاه همه احتمالاتیاند. هر کدام درصدی خطا دارند که هیچوقت صفر نمیشود.
حالا فرض کنید دو تشخیصدهنده دارید که هر کدام نود درصد مواقع درست میگویند. نمودار بالا دو راه چیدنشان را نشان میدهد.
اگر فرمان فقط وقتی درست اجرا شود که هر دو درست باشند، دقت کل به حدود هشتاد و یک درصد میرسد. یعنی تقریباً یک فرمان از هر پنج فرمان خراب است.
ولی اگر هر وجه بتواند اشتباه دیگری را جبران کند، دقت کل به حدود نود و نه درصد میرسد. این عدد با این فرض است که خطاهای دو کانال مستقل از هم باشند.
Sharon Oviatt در مقالهٔ معروف «ده افسانهٔ تعامل چندوجهی» (۱۹۹۹) همین را نشان داد. به نظر او این باور که ترکیب دو فناوری خطادار حتماً سیستم خطادارتری میسازد، یک افسانه است.
در سیستمی که خوب طراحی شده باشد، دو وجه همدیگر را روشن میکنند. اگر گفتار بین «اینجا» و «آنجا» مردد باشد، اشاره تکلیف را روشن میکند.
پس پرسش طراحی این نیست که چند وجه دارید. پرسش این است که وجههایتان پشت سر هم چیده شدهاند یا کنار هم.
غیر از این، چند حالت شکست دیگر هم پرتکرارند:
- - تعارض: کاربر میگوید «نه» ولی روی «تأیید» میزند. سیستم باید از پیش بداند کدام وجه در چه نوع تصمیمی حرف آخر را میزند.
- - فعال شدن ناخواسته: حرکتی که برای کس دیگری بود، یا جملهای در تلویزیون که شبیه کلمهٔ بیدارباش است.
- - ناهمزمانی: دو ورودی که کمی از هم فاصله دارند و سیستم آنها را دو فرمان جدا میفهمد.
- - بیخبری از وجهها: کاربر نمیداند میتواند حرف بزند، یا نمیداند که سیستم الان گوش میدهد.
Oviatt یک افسانهٔ دیگر را هم رد کرد که برای طراح مهم است. کاربران فقط چون رابط چندوجهی است، همهچیز را چندوجهی انجام نمیدهند.
بیشتر وقتها یک وجه را به کار میبرند و فقط در بعضی کارها، مخصوصاً کارهای مکانی، وجهها را ترکیب میکنند. پس لازم نیست هر فرمان را برای ترکیب طراحی کنید؛ باید بدانید کجا ترکیب طبیعی است.
و یک نکتهٔ آخر که منبع هم بر آن تأکید دارد: سیستم باید از استفاده یاد بگیرد. اگر یک حرکت خاص مدام با «لغو» دنبال میشود، یعنی سیستم دارد آن را اشتباه تفسیر میکند.
در بافت فارسی
این مسائل در محصولات جهانی هم هست، ولی اینجا شکل خودشان را دارند.
یک: تشخیص گفتار فارسی هنوز حلقهٔ ضعیف است. فاصلهٔ فارسی گفتاری و نوشتاری و تنوع لهجهها را در مقالهٔ رابط صوتی مفصل گفتهام. نتیجهاش برای رابط چندوجهی ساده است: صدا در محصول فارسی نباید هیچ نسبت اختصاصی داشته باشد. هر کاری که با صدا شدنی است، باید با لمس هم شدنی باشد.
دو: فرمانها دوزبانهاند. کاربر فارسی میگوید «اینو واسه علی share کن» یا «بلوتوث رو خاموش کن». مدلی که فقط فارسی یا فقط انگلیسی میفهمد، نیمی از این جمله را گم میکند.
سه: «چپ» و «راست» در رابط آینهای. جهت کشیدن در رابط راستبهچپ را در تعامل مبتنی بر حرکت بررسی کردهام. مسئلهٔ چندوجهیاش جای دیگری است: وقتی دستیار صوتی میگوید «دکمهٔ سمت چپ را بزنید»، ولی چیدمان برای فارسی آینه شده است. خروجی صوتی نباید به جای دکمه ارجاع دهد، باید به اسمش ارجاع دهد.
چهار: صدا در فضای مشترک حریم ندارد. در تاکسی، مترو یا یک خانهٔ شلوغ، گفتن یک عدد بلند یعنی همه آن را شنیدهاند. پس ماندهحساب، کد تأیید و نشانی خانه نباید با صدا خوانده شوند، مگر آنکه کاربر هدفون زده باشد.
پنج: اینترنت ناپایدار وجهها را نابرابر میکند. تشخیص گفتار معمولاً روی سرور انجام میشود، ولی لمس روی خود دستگاه. وقتی اینترنت کند یا قطع است، صدا از کار میافتد و لمس نه. همان مسیر جایگزینی که در بخش قبل گفتیم، اینجا یک ضرورت روزمره است، نه یک احتیاط.
جمعبندی
رابط چندوجهی یعنی بیش از یک کانال حسی، ولی چیزی که آن را خوب یا بد میکند تعداد کانالها نیست. نسبت میان آنهاست.
مکمل، اختصاصی، تکراری یا همارز؛ هر کدام از این چهار نسبت خطر خودش را دارد.
در خروجی، کانال را بافت انتخاب میکند، و بهترین جای وجههای غیردیداری پیگیری کارهای در جریان است. در ورودی، هر وجه تازه یک حدس تازه است. اینکه این حدسها خطا را ضرب کنند یا همدیگر را اصلاح کنند، به چیدمان آنها بستگی دارد.
اگر بخواهم یک پرسش بگذارم: در محصول شما، اگر فردا تشخیص گفتار از کار بیفتد، کدام کار دیگر انجامشدنی نیست؟
منبع
این نوشته «بازنویسی آزاد» است از موضوع Multimodal Interfaces منتشرشده در وبسایت بنیاد طراحی تعامل (Interaction Design Foundation — IxDF). صفحهٔ این موضوع متن تعریفی ندارد و تنها به مقالهٔ No-UI: How to Build Transparent Interaction نوشتهٔ Andreas Komninos ارجاع میدهد. مفاهیم پایهٔ برگرفته از آن مقاله — اینکه تعامل چندوجهی باید با هدف محصول و توانایی و موقعیت کاربر طراحی شود و نه با تقلید از بوق و لرزش اپهای رایج، نمونهٔ لرزش هنگام رد شدن از مقصد و تکان دادن برای شنیدن راهنمای گفتاری، نیاز به تشخیص عمدی یا تصادفی بودن حرکت، انتخاب پیام دیداری بهجای گفتار در محیط پرسروصدا، یادگیری سیستم از استفاده، پیوندش با رایانش آرام، یافتههای مربوط به ضعف تصویر ذهنی کاربران نقشهٔ گوشی، نمونههای پژوهشی ناوبری با موسیقی و صدای قدم و صدای آب و لرزش فزاینده و بازخورد حرارتی، هشدار دربارهٔ لرزش چند اپ همزمان، و این نتیجه که رویکرد غیردیداری در پیگیری کارهای جاری بیشترین کارایی را دارد — از این منبع گرفته شده، اما متن فارسی و توضیحها کاملاً مستقل نوشته شدهاند. بخش «دوست محلی» و سه بلوک ساختمانی همان مقاله پیشتر در طراحی بدون رابط آمده و اینجا تکرار نشده است.
متن مقالهٔ اصلی تحت هیچ لایسنس بازی منتشر نشده است؛ به همین دلیل اینجا ترجمهٔ کلمهبهکلمه ارائه نشده و متن کامل انگلیسی (بههمراه همهٔ تصاویر) در لینک زیر در دسترس است.
ارجاع بیرونی: نمونهٔ Put-That-There از مقالهٔ Richard A. Bolt با عنوان Put-That-There: Voice and Gesture at the Graphics Interface در SIGGRAPH (۱۹۸۰)؛ چهار نسبت از مقالهٔ Joëlle Coutaz و همکاران دربارهٔ ویژگیهای CARE در INTERACT (۱۹۹۵)؛ و دو افسانه از مقالهٔ Sharon Oviatt با عنوان Ten Myths of Multimodal Interaction در Communications of the ACM (۱۹۹۹). منبع هیچیک از این سه را نام نمیبرد.
بخشهای افزودهٔ مترجم: نمونهٔ آغازین مسیریابی که صدا و فلشش همسو یا ناهمسو هستند؛ تمایز «داشتن چند کانال» از «طراحی چندوجهی»؛ کل بخش «بگذارش آنجا» و این تحلیل که صدا برای «چه کاری» و اشاره برای «کجا» بهتر است؛ کل بخش «چهار نسبت میان دو وجه» شامل مکمل و اختصاصی و تکراری و همارز، خطر ویژهٔ هر کدام، پیوند نسبت همارز با دسترسپذیری و فناوری کمکی، و تمایز ادغام از جایگزینی و حساسیت ادغام به همزمانی؛ مثالهای جلسه و خیابان و رانندگی برای انتخاب کانال بر اساس بافت، و این تعمیم که کانالهای غیردیداری منبعی مشترک و محدودند؛ کل بخش «وقتی وجهها خطا را ضرب میکنند» شامل مقایسهٔ چیدن پشت سر هم و کنار هم دو تشخیصدهنده (هشتاد و یک در برابر نود و نه درصد با فرض خطای مستقل)، روشنسازی متقابل، تعارض و فعال شدن ناخواسته و ناهمزمانی و بیخبری از وجهها، و خواندن «لغو» پشت سر هم بهعنوان نشانهٔ تفسیر غلط؛ و کل بخش «در بافت فارسی» شامل منع نسبت اختصاصی برای صدا، فرمانهای دوزبانه، ارجاع صوتی به چپ و راست در چیدمان آینهای، حریم صدا در تاکسی و مترو، و نابرابری وجهها هنگام اینترنت ناپایدار.
تصاویر: تصاویر مقالهٔ اصلی لایسنسهای گوناگون دارند، از جمله Fair Use، CC BY 2.0، CC BY-SA 2.0، CC0، CC BY-NC 2.0 و یک تصویر با همهٔ حقوق محفوظ. هر سه نمودار این صفحه طراحی اختصاصی مترجم است و هیچ تصویری از منبع اصلی بازتولید نشده است.
مشاهدهٔ مقالهٔ اصلی
رابط چندوجهی