ارزیابی کیفیت هوش مصنوعی: از «به نظرم خوب است» تا سنجش نظاممند
محصول هوش مصنوعی را نمیشود با چند آزمایش دستی تأیید کرد. مجموعهی ارزیابی، معیارهای روشن و دروازهی کیفیت پیش از هر انتشار، تنها راه مطمئن برای تغییر مدل و دستورالعمل بدون خراب کردن محصول است.
در نرمافزار معمولی، اگر ورودی یکسان بدهید خروجی یکسان میگیرید و میشود برایش آزمون نوشت. در محصول هوش مصنوعی، همان پرسش ممکن است هر بار پاسخ کمی متفاوتی بگیرد و «درست» بودن هم همیشه سیاه و سفید نیست.
نتیجه این میشود که خیلی از تیمها کیفیت را با حس میسنجند: چند پرسش میپرسند، پاسخها خوب به نظر میرسد، منتشر میکنند. این روش تا اولین تغییر دوام میآورد.
چرا حس کافی نیست
- نمونههای دستچین. معمولاً همان پرسشهایی را امتحان میکنید که میدانید جواب میدهند.
- پسرفت نامرئی. اصلاح یک مورد، سه مورد دیگر را خراب میکند و کسی متوجه نمیشود.
- تغییر مدل. وقتی مدل عوض میشود، هیچ راهی برای مقایسه ندارید.
مجموعهی ارزیابی بسازید
مجموعهی ارزیابی فهرستی از ورودیهای واقعی است، همراه با اینکه خروجی خوب چه ویژگیهایی باید داشته باشد.
از کجا نمونه بیاوریم
- گفتگوهای واقعی. بهترین منبع، پیامهایی است که کاربران واقعاً فرستادهاند.
- موارد شکست. هر بار که دستیار اشتباه کرد، همان مورد به مجموعه اضافه شود.
- موارد مرزی. پرسش مبهم، خارج از محدوده، دوپهلو، عصبانی.
- تلاش برای دستکاری. ورودیهایی که میخواهند دستیار را از نقشش خارج کنند.
چند ده نمونهی خوب برای شروع کافی است. مهم این است که نمایندهی واقعیت باشد، نه اینکه بزرگ باشد.
چه چیزی را بسنجیم
بسته به محصول، معیارها فرق دارند. برای یک دستیار فروش:
- درستی: آیا اطلاعات با دانش فروشگاه میخواند؟
- وفاداری به منبع: آیا چیزی از خودش نساخته است؟
- کامل بودن: آیا به همهی بخشهای پرسش پاسخ داده؟
- لحن: آیا با شخصیت تعریفشده میخواند؟
- رفتار درست در ندانستن: آیا وقتی باید، به انسان سپرده؟
- اقدام درست: اگر عامل است، آیا ابزار درست را با ورودی درست صدا زده؟
سه روش سنجش
بررسی قاعدهمحور. برای چیزهایی که قطعیاند: آیا قیمت درست آمده؟ آیا ابزار درست صدا زده شد؟ آیا پاسخ از طول مجاز بیشتر نیست؟ اینها سریع، ارزان و قابلاعتمادند.
داوری با مدل. برای کیفیتهایی مثل لحن یا کامل بودن، میشود از یک مدل دیگر با معیار روشن برای نمره دادن استفاده کرد. مفید است ولی بیخطا نیست و خودش باید گاهی با داوری انسان مقایسه شود.
بازبینی انسانی. برای نمونهای از موارد، بهویژه موارد حساس، هیچ چیز جای خواندن انسان را نمیگیرد.
ترکیب این سه، تصویر قابلاتکایی میدهد.
دروازهی کیفیت پیش از انتشار
ارزیابی وقتی ارزش دارد که جلوی انتشار نسخهی بدتر را بگیرد. قاعدهی ساده:
- هر تغییر در دستورالعمل، مدل یا روش بازیابی، مجموعهی ارزیابی را اجرا میکند.
- نتیجه با نسخهی قبلی مقایسه میشود.
- اگر شاخصهای اصلی افت کرده باشند، تغییر منتشر نمیشود.
این همان منطق دروازههای تأیید در روش کار من است، فقط برای جزء هوشمند محصول.
سنجش بعد از انتشار
مجموعهی ارزیابی همهچیز را نمیگیرد. در محیط واقعی هم باید نگاه کنید:
- نرخ انتقال به انسان. بالا رفتن ناگهانی یعنی چیزی خراب شده.
- گفتگوهای رهاشده. کاربر وسط کار رفته است.
- بازخورد مستقیم. اگر راهی برای گفتن «این پاسخ کمک نکرد» بدهید، ارزشمندترین داده را میگیرید.
- هزینهی هر نتیجه. کیفیت و هزینه را با هم ببینید.
هر مورد جالبی که در محیط واقعی پیدا شد، به مجموعهی ارزیابی برمیگردد. این حلقه، محصول را بهمرور محکمتر میکند.
اشتباههای رایج
- سنجیدن فقط با نمونههای آسان.
- یک عدد کلی. میانگین خوب میتواند شکست کامل در یک دستهی مهم را پنهان کند. نتیجه را به تفکیک دسته ببینید.
- فراموش کردن حریم خصوصی. گفتگوهای واقعی پیش از ورود به مجموعه باید از اطلاعات شخصی پاک شوند.
- ارزیابی یکباره. مجموعهای که بهروز نشود، بهتدریج از واقعیت فاصله میگیرد.
جمعبندی
تفاوت یک نمونهی نمایشی با یک محصول هوش مصنوعی، در ارزیابی است. با مجموعهای از نمونههای واقعی، معیار روشن و دروازهای که پسرفت را متوقف میکند، میتوانید مدل و دستورالعمل را با اطمینان تغییر دهید.
مطلب مرتبط: هوش مصنوعی در محصول: هسته، نه تزئین.