سپنتا پویا — طراح محصول

چهار نسبت میان صدا و لمس: مکمل، که هر وجه نیمی از فرمان را می‌برد؛ اختصاصی، که فقط یک وجه کار را انجام می‌دهد؛ تکراری، که هر دو همان پیام را می‌برند؛ و هم‌ارز، که هر کدام به‌تنهایی کافی است
منبع: بنیاد طراحی تعامل (IxDF) · بازنویسی آزاد: سپنتا پویا · مهر ۱۴۰۵ · زمان مطالعه: حدود ۱۱ دقیقه

رابط چندوجهی (Multimodal Interface) چیست؟

💡 این متن «بازنویسی آزاد» است: ایده‌ها و مفاهیم مطلب اصلی با نگارش کاملاً مستقل فارسی و مثال‌های تازه بازگو شده‌اند و ترجمهٔ کلمه‌به‌کلمه نیست. بخش‌های افزودهٔ مترجم در جعبهٔ منبع مشخص شده‌اند.

در حال رانندگی هستید و مسیریاب می‌گوید «سیصد متر دیگر به راست بپیچید». هم‌زمان روی صفحه یک فلش بزرگ ظاهر می‌شود.

شما به صفحه نگاه نمی‌کنید، ولی اگر صدا را نشنیده باشید، یک نگاه کوتاه کافی است. این دو کانال یک پیام را با دو زبان می‌گویند، و همین است که مسیریاب را قابل اعتماد می‌کند.

حالا تصور کنید صدا بگوید «راست» و فلش به چپ اشاره کند. آن لحظه، بدترین رابطی است که می‌شود ساخت.

رابط چندوجهی چیست؟

رابط چندوجهی رابطی است که از بیش از یک کانال حسی برای گرفتن ورودی یا دادن خروجی استفاده می‌کند. صدا، لمس، حرکت دست، نگاه، لرزش و حتی گرما، هر کدام یک «وجه» حساب می‌شوند.

به این معنا، تقریباً هر گوشی امروزی چندوجهی است. ولی داشتن چند کانال با طراحی چندوجهی یکی نیست.

بیشتر اپ‌ها هنوز یک رابط گرافیکی‌اند که اینجا و آنجا یک بوق یا یک لرزش کوتاه به آن چسبیده است. آن بوق طراحی نشده؛ فقط اضافه شده است.

نکتهٔ اصلی منبع همین‌جاست. نباید فرض کنید بلدید تعامل چندوجهی را درست تحویل دهید، فقط چون هر روز با بوق‌ها و لرزش‌های اپ‌های دیگر زندگی می‌کنید.

هر کانال باید با هدف مشخص محصول، توانایی کاربر و موقعیتی که در آن است انتخاب شود. و این انتخاب را فقط آزمودن با کاربر واقعی تأیید می‌کند.

هر کدام از این وجه‌ها در این مجموعه مقالهٔ خودش را دارد: رابط صوتی، تعامل مبتنی بر حرکت، رابط لمسی‌بازخوردی و ردیابی چشم. موضوع این مقاله خود وجه‌ها نیست، نسبت میان آن‌هاست.

«بگذارش آنجا»: جایی که ماجرا شروع شد

در سال ۱۹۸۰، Richard Bolt در MIT نمونه‌ای ساخت که هنوز مرجع این حوزه است. اسمش را از جمله‌ای گرفت که کاربر به آن می‌گفت: Put That There.

کاربر روی صندلی جلوی یک دیوار نمایش بزرگ می‌نشست. به یک شکل اشاره می‌کرد و می‌گفت «آن را»، بعد به نقطهٔ دیگری اشاره می‌کرد و می‌گفت «بگذار آنجا».

هیچ‌کدام از دو کانال به‌تنهایی معنا نداشت. جملهٔ «بگذارش آنجا» بدون اشاره، نمی‌گوید چه چیزی و کجا. اشاره هم بدون جمله، نمی‌گوید چه کاری.

این همان بینش پایه است. صدا برای گفتنِ چه کاری خوب است و اشاره برای گفتنِ کجا. هر وجه نیمی از فرمان را می‌برد که در آن بهتر است.

چهار نسبت میان دو وجه

پانزده سال بعد، Joëlle Coutaz و همکارانش این نسبت‌ها را در چهار دسته نام‌گذاری کردند. نمودار بالای صفحه همین چهار دسته را نشان می‌دهد:

  • - مکمل: هر وجه بخشی از پیام را می‌برد و معنا از ترکیبشان ساخته می‌شود. همان «بگذارش آنجا».
  • - اختصاصی: یک کار فقط از یک وجه انجام می‌شود. مثلاً رمز را فقط تایپ می‌کنید و هرگز بلند نمی‌گویید.
  • - تکراری: هر دو وجه همان پیام را هم‌زمان می‌برند. صدای مسیریاب و فلش روی صفحه.
  • - هم‌ارز: هر کدام به‌تنهایی کافی است و کاربر انتخاب می‌کند. جست‌وجو را هم می‌شود تایپ کرد، هم گفت.

این دسته‌بندی فقط یک واژه‌نامه نیست، چون هر نسبت یک خطر متفاوت دارد.

نسبت مکمل قوی‌ترین است، ولی شکننده‌ترین هم هست. اگر یکی از دو نیمه گم شود، کل فرمان از دست می‌رود.

نسبت تکراری امن است، ولی می‌تواند آزاردهنده شود. کاربری که صفحه را دیده، شنیدن دوبارهٔ همان پیام را اضافه‌گویی می‌داند.

نسبت هم‌ارز از همه به دسترس‌پذیری نزدیک‌تر است. کسی که نمی‌تواند حرف بزند تایپ می‌کند، و کسی که نمی‌تواند تایپ کند حرف می‌زند.

برای کاربرانی که با فناوری کمکی کار می‌کنند، این نسبت یک امتیاز اضافه نیست. تنها راه ورود است.

یک تمایز مهندسی هم اینجا هست. ادغام یعنی سیستم دو ورودی را کنار هم می‌گذارد تا یک معنا بسازد. جایگزینی یعنی اگر یک کانال شکست خورد، سراغ دیگری می‌رود.

اولی در زمان اتفاق می‌افتد و به هم‌زمانی حساس است. اشاره‌ای که یک ثانیه دیرتر از «آنجا» برسد، ممکن است به نقطهٔ غلطی وصل شود. دومی به طراحی مسیر برگشت نیاز دارد، و این مسیر معمولاً فراموش می‌شود.

خروجی: کانال را بافت انتخاب می‌کند

تمرکز منبع روی خروجی است، نه ورودی. استدلالش این است که رابط گرافیکی تمام توجه کاربر را می‌خواهد، در حالی که بیشتر اطلاعاتی که لازم داریم کوتاه است.

یک پیشنهاد رستوران، شمارهٔ تلفن یک نفر، یا پیش‌بینی هوای عصر، این‌ها چند کلمه‌اند. برای گرفتنشان نباید گوشی را از جیب درآورد و در یک اپ گشت.

این همان ایدهٔ رایانش آرام است: اطلاعات باید در حاشیهٔ توجه بماند، نه در مرکز آن. و وجه‌های غیردیداری ابزار اصلی رسیدن به آن حاشیه‌اند.

هزینهٔ نگاه مداوم به صفحه هم فقط وقت نیست. پژوهش‌هایی که منبع به آن‌ها اشاره می‌کند نشان دادند کسی که با نقشهٔ گوشی در شهر راه می‌رود، تصویر ذهنی ضعیف‌تری از محیط می‌سازد.

چنین کسی نشانه‌های مهم را کمتر می‌بیند و فقط مسیر بین دو نقطه را یاد می‌گیرد. در مقابل، کسی که نقشهٔ کاغذی داشت، تصویر کامل‌تری از کل محدوده ساخت.

منبع چند نمونهٔ پژوهشی برای جایگزین کردن صفحه می‌آورد، که هر کدام یک ایدهٔ قابل استفاده دارد:

  • - موسیقی به‌جای فلش: صدای موسیقی در هدفون از سمتِ مقصد می‌آید و هرچه دورتر باشید آرام‌تر می‌شود.
  • - صدای قدم‌ها: صدای گام‌های یک نفر از جهت نزدیک‌ترین تکهٔ مسیر پخش می‌شود. صدایی که در خیابان غریبه نیست و حواس را پرت نمی‌کند.
  • - صدای آب: شدت جریان آب نشان می‌دهد در آن محله چقدر دربارهٔ چیزی حرف زده می‌شود، و هر پیام تازه مثل سنگی در آن می‌افتد.
  • - لرزشی که بزرگ می‌شود: یک لرزش تقریباً نامحسوس که با هر تماس از دست رفته کمی قوی‌تر و تندتر می‌شود.
  • - گرما: صفحه‌ای که گرم یا سرد می‌شود تا بگوید پیام تازه کاری است یا شخصی، و چقدر مهم است.

وجه مشترک همهٔ این‌ها یک چیز است. کاربر وضعیت یک کار جاری را دنبال می‌کند، بی‌آنکه برای هر به‌روزرسانی به صفحه نگاه کند.

منبع هم نتیجه می‌گیرد که رویکرد غیردیداری بیشترین کارایی را همین‌جا دارد: پیگیری کارهای در جریان و خبرهای مهمی که تازه رسیده‌اند.

ولی انتخاب کانال ثابت نیست. در خیابان پرسروصدا، گفتار مصنوعی شنیده نمی‌شود و یک پیام روی صفحه بهتر است. در جلسه، لرزش از صدا بهتر است. در رانندگی، صدا از صفحه بهتر است.

یعنی یک پیام واحد در سه موقعیت، سه کانال متفاوت لازم دارد. تشخیص اینکه الان کدام موقعیت است، کار آگاهی از بافت است.

منبع دربارهٔ لرزش هشداری هم دارد. یک اپ که با لرزش خبر می‌دهد قابل تحمل است. پنج اپ که هر کدام همین کار را می‌کنند، گوشی را به یک مزاحم دائمی تبدیل می‌کنند.

کانال‌های غیردیداری هم منبع محدودی‌اند و همهٔ اپ‌ها از یک انبار برمی‌دارند.

وقتی وجه‌ها خطا را ضرب می‌کنند

این بخش در منبع نیست، ولی به نظر من جایی است که بیشتر محصولات چندوجهی واقعاً شکست می‌خورند.

منبع فقط اشاره می‌کند که سیستم باید بفهمد کاربر گوشی را عمداً تکان داده یا تصادفی. این سؤال کوچک، دری به یک مسئلهٔ بزرگ‌تر است: هر وجه تازه، یک حدس تازه است.

صفحهٔ لمسی تقریباً هرگز اشتباه نمی‌کند. ولی تشخیص گفتار، تشخیص حرکت و ردیابی نگاه همه احتمالاتی‌اند. هر کدام درصدی خطا دارند که هیچ‌وقت صفر نمی‌شود.

دو شیوهٔ چیدن دو تشخیص‌دهندهٔ نود درصدی: اگر هر دو باید درست باشند، دقت کل به هشتاد و یک درصد می‌رسد؛ اگر هر کدام بتواند دیگری را تأیید یا جبران کند، به نود و نه درصد می‌رسد
نمودار از سپنتا پویا برای این ترجمه (sepantapouya.com)

حالا فرض کنید دو تشخیص‌دهنده دارید که هر کدام نود درصد مواقع درست می‌گویند. نمودار بالا دو راه چیدنشان را نشان می‌دهد.

اگر فرمان فقط وقتی درست اجرا شود که هر دو درست باشند، دقت کل به حدود هشتاد و یک درصد می‌رسد. یعنی تقریباً یک فرمان از هر پنج فرمان خراب است.

ولی اگر هر وجه بتواند اشتباه دیگری را جبران کند، دقت کل به حدود نود و نه درصد می‌رسد. این عدد با این فرض است که خطاهای دو کانال مستقل از هم باشند.

Sharon Oviatt در مقالهٔ معروف «ده افسانهٔ تعامل چندوجهی» (۱۹۹۹) همین را نشان داد. به نظر او این باور که ترکیب دو فناوری خطادار حتماً سیستم خطادارتری می‌سازد، یک افسانه است.

در سیستمی که خوب طراحی شده باشد، دو وجه همدیگر را روشن می‌کنند. اگر گفتار بین «اینجا» و «آنجا» مردد باشد، اشاره تکلیف را روشن می‌کند.

پس پرسش طراحی این نیست که چند وجه دارید. پرسش این است که وجه‌هایتان پشت سر هم چیده شده‌اند یا کنار هم.

غیر از این، چند حالت شکست دیگر هم پرتکرارند:

  • - تعارض: کاربر می‌گوید «نه» ولی روی «تأیید» می‌زند. سیستم باید از پیش بداند کدام وجه در چه نوع تصمیمی حرف آخر را می‌زند.
  • - فعال شدن ناخواسته: حرکتی که برای کس دیگری بود، یا جمله‌ای در تلویزیون که شبیه کلمهٔ بیدارباش است.
  • - ناهم‌زمانی: دو ورودی که کمی از هم فاصله دارند و سیستم آن‌ها را دو فرمان جدا می‌فهمد.
  • - بی‌خبری از وجه‌ها: کاربر نمی‌داند می‌تواند حرف بزند، یا نمی‌داند که سیستم الان گوش می‌دهد.

Oviatt یک افسانهٔ دیگر را هم رد کرد که برای طراح مهم است. کاربران فقط چون رابط چندوجهی است، همه‌چیز را چندوجهی انجام نمی‌دهند.

بیشتر وقت‌ها یک وجه را به کار می‌برند و فقط در بعضی کارها، مخصوصاً کارهای مکانی، وجه‌ها را ترکیب می‌کنند. پس لازم نیست هر فرمان را برای ترکیب طراحی کنید؛ باید بدانید کجا ترکیب طبیعی است.

و یک نکتهٔ آخر که منبع هم بر آن تأکید دارد: سیستم باید از استفاده یاد بگیرد. اگر یک حرکت خاص مدام با «لغو» دنبال می‌شود، یعنی سیستم دارد آن را اشتباه تفسیر می‌کند.

در بافت فارسی

این مسائل در محصولات جهانی هم هست، ولی اینجا شکل خودشان را دارند.

پنج چالش رابط چندوجهی در محصول فارسی: تشخیص گفتار فارسی و لهجه‌ها، فرمان‌های دوزبانه، ارجاع به چپ و راست در رابط آینه‌ای، حریم صدا در فضای مشترک، و اینترنت ناپایدار
نمودار از سپنتا پویا برای این ترجمه (sepantapouya.com)

یک: تشخیص گفتار فارسی هنوز حلقهٔ ضعیف است. فاصلهٔ فارسی گفتاری و نوشتاری و تنوع لهجه‌ها را در مقالهٔ رابط صوتی مفصل گفته‌ام. نتیجه‌اش برای رابط چندوجهی ساده است: صدا در محصول فارسی نباید هیچ نسبت اختصاصی داشته باشد. هر کاری که با صدا شدنی است، باید با لمس هم شدنی باشد.

دو: فرمان‌ها دوزبانه‌اند. کاربر فارسی می‌گوید «اینو واسه علی share کن» یا «بلوتوث رو خاموش کن». مدلی که فقط فارسی یا فقط انگلیسی می‌فهمد، نیمی از این جمله را گم می‌کند.

سه: «چپ» و «راست» در رابط آینه‌ای. جهت کشیدن در رابط راست‌به‌چپ را در تعامل مبتنی بر حرکت بررسی کرده‌ام. مسئلهٔ چندوجهی‌اش جای دیگری است: وقتی دستیار صوتی می‌گوید «دکمهٔ سمت چپ را بزنید»، ولی چیدمان برای فارسی آینه شده است. خروجی صوتی نباید به جای دکمه ارجاع دهد، باید به اسمش ارجاع دهد.

چهار: صدا در فضای مشترک حریم ندارد. در تاکسی، مترو یا یک خانهٔ شلوغ، گفتن یک عدد بلند یعنی همه آن را شنیده‌اند. پس مانده‌حساب، کد تأیید و نشانی خانه نباید با صدا خوانده شوند، مگر آنکه کاربر هدفون زده باشد.

پنج: اینترنت ناپایدار وجه‌ها را نابرابر می‌کند. تشخیص گفتار معمولاً روی سرور انجام می‌شود، ولی لمس روی خود دستگاه. وقتی اینترنت کند یا قطع است، صدا از کار می‌افتد و لمس نه. همان مسیر جایگزینی که در بخش قبل گفتیم، اینجا یک ضرورت روزمره است، نه یک احتیاط.

جمع‌بندی

رابط چندوجهی یعنی بیش از یک کانال حسی، ولی چیزی که آن را خوب یا بد می‌کند تعداد کانال‌ها نیست. نسبت میان آن‌هاست.

مکمل، اختصاصی، تکراری یا هم‌ارز؛ هر کدام از این چهار نسبت خطر خودش را دارد.

در خروجی، کانال را بافت انتخاب می‌کند، و بهترین جای وجه‌های غیردیداری پیگیری کارهای در جریان است. در ورودی، هر وجه تازه یک حدس تازه است. اینکه این حدس‌ها خطا را ضرب کنند یا همدیگر را اصلاح کنند، به چیدمان آن‌ها بستگی دارد.

اگر بخواهم یک پرسش بگذارم: در محصول شما، اگر فردا تشخیص گفتار از کار بیفتد، کدام کار دیگر انجام‌شدنی نیست؟

منبع

این نوشته «بازنویسی آزاد» است از موضوع Multimodal Interfaces منتشرشده در وب‌سایت بنیاد طراحی تعامل (Interaction Design Foundation — IxDF). صفحهٔ این موضوع متن تعریفی ندارد و تنها به مقالهٔ No-UI: How to Build Transparent Interaction نوشتهٔ Andreas Komninos ارجاع می‌دهد. مفاهیم پایهٔ برگرفته از آن مقاله — اینکه تعامل چندوجهی باید با هدف محصول و توانایی و موقعیت کاربر طراحی شود و نه با تقلید از بوق و لرزش اپ‌های رایج، نمونهٔ لرزش هنگام رد شدن از مقصد و تکان دادن برای شنیدن راهنمای گفتاری، نیاز به تشخیص عمدی یا تصادفی بودن حرکت، انتخاب پیام دیداری به‌جای گفتار در محیط پرسروصدا، یادگیری سیستم از استفاده، پیوندش با رایانش آرام، یافته‌های مربوط به ضعف تصویر ذهنی کاربران نقشهٔ گوشی، نمونه‌های پژوهشی ناوبری با موسیقی و صدای قدم و صدای آب و لرزش فزاینده و بازخورد حرارتی، هشدار دربارهٔ لرزش چند اپ هم‌زمان، و این نتیجه که رویکرد غیردیداری در پیگیری کارهای جاری بیشترین کارایی را دارد — از این منبع گرفته شده، اما متن فارسی و توضیح‌ها کاملاً مستقل نوشته شده‌اند. بخش «دوست محلی» و سه بلوک ساختمانی همان مقاله پیش‌تر در طراحی بدون رابط آمده و اینجا تکرار نشده است.

متن مقالهٔ اصلی تحت هیچ لایسنس بازی منتشر نشده است؛ به همین دلیل اینجا ترجمهٔ کلمه‌به‌کلمه ارائه نشده و متن کامل انگلیسی (به‌همراه همهٔ تصاویر) در لینک زیر در دسترس است.

ارجاع بیرونی: نمونهٔ Put-That-There از مقالهٔ Richard A. Bolt با عنوان Put-That-There: Voice and Gesture at the Graphics Interface در SIGGRAPH (۱۹۸۰)؛ چهار نسبت از مقالهٔ Joëlle Coutaz و همکاران دربارهٔ ویژگی‌های CARE در INTERACT (۱۹۹۵)؛ و دو افسانه از مقالهٔ Sharon Oviatt با عنوان Ten Myths of Multimodal Interaction در Communications of the ACM (۱۹۹۹). منبع هیچ‌یک از این سه را نام نمی‌برد.

بخش‌های افزودهٔ مترجم: نمونهٔ آغازین مسیریابی که صدا و فلشش هم‌سو یا ناهم‌سو هستند؛ تمایز «داشتن چند کانال» از «طراحی چندوجهی»؛ کل بخش «بگذارش آنجا» و این تحلیل که صدا برای «چه کاری» و اشاره برای «کجا» بهتر است؛ کل بخش «چهار نسبت میان دو وجه» شامل مکمل و اختصاصی و تکراری و هم‌ارز، خطر ویژهٔ هر کدام، پیوند نسبت هم‌ارز با دسترس‌پذیری و فناوری کمکی، و تمایز ادغام از جایگزینی و حساسیت ادغام به هم‌زمانی؛ مثال‌های جلسه و خیابان و رانندگی برای انتخاب کانال بر اساس بافت، و این تعمیم که کانال‌های غیردیداری منبعی مشترک و محدودند؛ کل بخش «وقتی وجه‌ها خطا را ضرب می‌کنند» شامل مقایسهٔ چیدن پشت سر هم و کنار هم دو تشخیص‌دهنده (هشتاد و یک در برابر نود و نه درصد با فرض خطای مستقل)، روشن‌سازی متقابل، تعارض و فعال شدن ناخواسته و ناهم‌زمانی و بی‌خبری از وجه‌ها، و خواندن «لغو» پشت سر هم به‌عنوان نشانهٔ تفسیر غلط؛ و کل بخش «در بافت فارسی» شامل منع نسبت اختصاصی برای صدا، فرمان‌های دوزبانه، ارجاع صوتی به چپ و راست در چیدمان آینه‌ای، حریم صدا در تاکسی و مترو، و نابرابری وجه‌ها هنگام اینترنت ناپایدار.

تصاویر: تصاویر مقالهٔ اصلی لایسنس‌های گوناگون دارند، از جمله Fair Use، CC BY 2.0، CC BY-SA 2.0، CC0، CC BY-NC 2.0 و یک تصویر با همهٔ حقوق محفوظ. هر سه نمودار این صفحه طراحی اختصاصی مترجم است و هیچ تصویری از منبع اصلی بازتولید نشده است.

مشاهدهٔ مقالهٔ اصلی
سپنتا پویا

مترجم: سپنتا پویا

طراح ارشد محصول. مقالات تخصصی UI/UX را با حفظ ساختار و لحن نسخهٔ اصلی به فارسی برمی‌گردانم.

دربارهٔ من

در این مقاله

  • - رابط چندوجهی چیست؟
  • - «بگذارش آنجا»: جایی که ماجرا شروع شد
  • - چهار نسبت میان دو وجه
  • - خروجی: کانال را بافت انتخاب می‌کند
  • - وقتی وجه‌ها خطا را ضرب می‌کنند
  • - در بافت فارسی
  • - جمع‌بندی

برچسب‌ها

  • رابط کاربری
  • صدا
  • تعامل
  • ترجمه