حالت نقشه‌ی فنی فعال است — تصمیم‌های طراحی این سایت را ببینید

ارزیابی کیفیت هوش مصنوعی: از «به نظرم خوب است» تا سنجش نظام‌مند

محصول هوش مصنوعی را نمی‌شود با چند آزمایش دستی تأیید کرد. مجموعه‌ی ارزیابی، معیارهای روشن و دروازه‌ی کیفیت پیش از هر انتشار، تنها راه مطمئن برای تغییر مدل و دستورالعمل بدون خراب کردن محصول است.

در نرم‌افزار معمولی، اگر ورودی یکسان بدهید خروجی یکسان می‌گیرید و می‌شود برایش آزمون نوشت. در محصول هوش مصنوعی، همان پرسش ممکن است هر بار پاسخ کمی متفاوتی بگیرد و «درست» بودن هم همیشه سیاه و سفید نیست.

نتیجه این می‌شود که خیلی از تیم‌ها کیفیت را با حس می‌سنجند: چند پرسش می‌پرسند، پاسخ‌ها خوب به نظر می‌رسد، منتشر می‌کنند. این روش تا اولین تغییر دوام می‌آورد.

چرا حس کافی نیست

  • نمونه‌های دست‌چین. معمولاً همان پرسش‌هایی را امتحان می‌کنید که می‌دانید جواب می‌دهند.
  • پسرفت نامرئی. اصلاح یک مورد، سه مورد دیگر را خراب می‌کند و کسی متوجه نمی‌شود.
  • تغییر مدل. وقتی مدل عوض می‌شود، هیچ راهی برای مقایسه ندارید.

مجموعه‌ی ارزیابی بسازید

مجموعه‌ی ارزیابی فهرستی از ورودی‌های واقعی است، همراه با اینکه خروجی خوب چه ویژگی‌هایی باید داشته باشد.

از کجا نمونه بیاوریم

  • گفتگوهای واقعی. بهترین منبع، پیام‌هایی است که کاربران واقعاً فرستاده‌اند.
  • موارد شکست. هر بار که دستیار اشتباه کرد، همان مورد به مجموعه اضافه شود.
  • موارد مرزی. پرسش مبهم، خارج از محدوده، دوپهلو، عصبانی.
  • تلاش برای دستکاری. ورودی‌هایی که می‌خواهند دستیار را از نقشش خارج کنند.

چند ده نمونه‌ی خوب برای شروع کافی است. مهم این است که نماینده‌ی واقعیت باشد، نه اینکه بزرگ باشد.

چه چیزی را بسنجیم

بسته به محصول، معیارها فرق دارند. برای یک دستیار فروش:

  • درستی: آیا اطلاعات با دانش فروشگاه می‌خواند؟
  • وفاداری به منبع: آیا چیزی از خودش نساخته است؟
  • کامل بودن: آیا به همه‌ی بخش‌های پرسش پاسخ داده؟
  • لحن: آیا با شخصیت تعریف‌شده می‌خواند؟
  • رفتار درست در ندانستن: آیا وقتی باید، به انسان سپرده؟
  • اقدام درست: اگر عامل است، آیا ابزار درست را با ورودی درست صدا زده؟

سه روش سنجش

بررسی قاعده‌محور. برای چیزهایی که قطعی‌اند: آیا قیمت درست آمده؟ آیا ابزار درست صدا زده شد؟ آیا پاسخ از طول مجاز بیشتر نیست؟ این‌ها سریع، ارزان و قابل‌اعتمادند.

داوری با مدل. برای کیفیت‌هایی مثل لحن یا کامل بودن، می‌شود از یک مدل دیگر با معیار روشن برای نمره دادن استفاده کرد. مفید است ولی بی‌خطا نیست و خودش باید گاهی با داوری انسان مقایسه شود.

بازبینی انسانی. برای نمونه‌ای از موارد، به‌ویژه موارد حساس، هیچ چیز جای خواندن انسان را نمی‌گیرد.

ترکیب این سه، تصویر قابل‌اتکایی می‌دهد.

دروازه‌ی کیفیت پیش از انتشار

ارزیابی وقتی ارزش دارد که جلوی انتشار نسخه‌ی بدتر را بگیرد. قاعده‌ی ساده:

  1. هر تغییر در دستورالعمل، مدل یا روش بازیابی، مجموعه‌ی ارزیابی را اجرا می‌کند.
  2. نتیجه با نسخه‌ی قبلی مقایسه می‌شود.
  3. اگر شاخص‌های اصلی افت کرده باشند، تغییر منتشر نمی‌شود.

این همان منطق دروازه‌های تأیید در روش کار من است، فقط برای جزء هوشمند محصول.

سنجش بعد از انتشار

مجموعه‌ی ارزیابی همه‌چیز را نمی‌گیرد. در محیط واقعی هم باید نگاه کنید:

  • نرخ انتقال به انسان. بالا رفتن ناگهانی یعنی چیزی خراب شده.
  • گفتگوهای رهاشده. کاربر وسط کار رفته است.
  • بازخورد مستقیم. اگر راهی برای گفتن «این پاسخ کمک نکرد» بدهید، ارزشمندترین داده را می‌گیرید.
  • هزینه‌ی هر نتیجه. کیفیت و هزینه را با هم ببینید.

هر مورد جالبی که در محیط واقعی پیدا شد، به مجموعه‌ی ارزیابی برمی‌گردد. این حلقه، محصول را به‌مرور محکم‌تر می‌کند.

اشتباه‌های رایج

  • سنجیدن فقط با نمونه‌های آسان.
  • یک عدد کلی. میانگین خوب می‌تواند شکست کامل در یک دسته‌ی مهم را پنهان کند. نتیجه را به تفکیک دسته ببینید.
  • فراموش کردن حریم خصوصی. گفتگوهای واقعی پیش از ورود به مجموعه باید از اطلاعات شخصی پاک شوند.
  • ارزیابی یک‌باره. مجموعه‌ای که به‌روز نشود، به‌تدریج از واقعیت فاصله می‌گیرد.

جمع‌بندی

تفاوت یک نمونه‌ی نمایشی با یک محصول هوش مصنوعی، در ارزیابی است. با مجموعه‌ای از نمونه‌های واقعی، معیار روشن و دروازه‌ای که پسرفت را متوقف می‌کند، می‌توانید مدل و دستورالعمل را با اطمینان تغییر دهید.

مطلب مرتبط: هوش مصنوعی در محصول: هسته، نه تزئین.

نویسنده

محمد علی اسلامی‌پور

محمد علی اسلامی‌پور معمار محصول دیجیتال است؛ محصولات هوش مصنوعی، SaaS و اپ‌های وب را از تعریف مسئله و معماری سامانه تا انتشار، همراه تیم توسعه‌ی خودش هدایت می‌کند.