کنترل هزینهی هوش مصنوعی: دروازهی چندمدلی و بودجهی هر گفتگو
در محصول هوش مصنوعی، هر پاسخ هزینه دارد و رشد کاربر میتواند به رشد زیان تبدیل شود. دروازهی چندمدلی، انتخاب مدل متناسب با کار، کش و سقف مصرف، هزینه را قابلپیشبینی میکنند.
در نرمافزار معمولی، هزینهی سرویس دادن به کاربر هزارم با کاربر اول تفاوت چندانی ندارد. در محصول هوش مصنوعی اینطور نیست: هر پیام، هر پاسخ و هر سند پردازششده هزینهی مستقیم دارد.
اگر این هزینه از ابتدا در طراحی دیده نشود، روزی میرسد که هر مشتری جدید، حاشیهی سود را کوچکتر میکند.
هزینه از کجا میآید
هزینهی مدلهای زبانی بر اساس حجم متن ورودی و خروجی حساب میشود. سه چیز آن را بالا میبرد:
- زمینهی طولانی. هر بار که کل تاریخچهی گفتگو و ده سند را برای مدل میفرستید، برای همهاش پول میدهید.
- مدل بزرگ برای کار کوچک. استفاده از قویترین مدل برای تشخیص اینکه پیام «سلام» است.
- تکرار. پاسخ دادن چندباره به پرسش یکسان.
دروازهی چندمدلی
اولین قدم این است که محصول مستقیماً به یک ارائهدهنده وابسته نباشد. همهی درخواستها از یک لایهی مرکزی عبور میکنند که من آن را دروازه مینامم.
این همان الگوی لایههای قابلتعویض است که برای مدلها به کار رفته. دروازه چند کار را در یک نقطه انجام میدهد:
- انتخاب مدل بر اساس نوع کار.
- شمارش مصرف به تفکیک مشتری و قابلیت.
- اعمال سقف و جلوگیری از مصرف غیرعادی.
- جایگزینی وقتی یک ارائهدهنده در دسترس نیست.
- ثبت برای بررسی کیفیت و هزینه.
بدون این لایه، هر کدام از این کارها باید در ده جای کد تکرار شود.
مدل متناسب با کار
همهی کارها به قویترین مدل نیاز ندارند. یک تقسیمبندی عملی:
| نوع کار | مدل مناسب |
|---|---|
| دستهبندی، تشخیص نیت، استخراج ساده | مدل کوچک و سریع |
| پاسخگویی معمول از روی دانش مشخص | مدل میانرده |
| استدلال چندمرحلهای، تحلیل سند پیچیده | مدل قوی |
در یک دستیار فروش، بخش بزرگی از پیامها سادهاند. اگر اینها به مدل کوچک بروند و فقط موارد سخت به مدل قوی برسند، هزینه به شکل چشمگیری پایین میآید بدون اینکه کیفیت در موارد مهم افت کند.
کوتاه کردن زمینه
- فقط اطلاعات مرتبط را بفرستید. به جای کل کاتالوگ، همان چند محصولی که به پرسش ربط دارند.
- تاریخچه را خلاصه کنید. در گفتگوی طولانی، پیامهای قدیمی را خلاصه نگه دارید.
- دستورالعمل را فشرده بنویسید. متن ثابتی که با هر درخواست فرستاده میشود، هزاران بار تکرار میشود.
کش
پرسشهای پرتکرار پاسخهای مشابه دارند. ذخیرهی پاسخ برای پرسشهای یکسان یا بسیار نزدیک، هم هزینه را کم میکند و هم سرعت را بالا میبرد. فقط باید مراقب بود که پاسخ کششده برای دادهای که عوض شده، مثل قیمت و موجودی، معتبر بماند.
سقف و بودجه
در محصول SaaS، هر مشتری باید بودجهی مشخصی داشته باشد:
- سقف متناسب با طرح اشتراک. مصرف باید با درآمد از آن مشتری تناسب داشته باشد.
- هشدار پیش از رسیدن به سقف. نه قطع ناگهانی.
- رفتار مشخص بعد از سقف. مثلاً محدود شدن به مدل ارزانتر یا سپردن به اپراتور انسانی.
- تشخیص مصرف غیرعادی. یک حلقهی معیوب یا سوءاستفاده نباید یکشبه بودجه را تمام کند.
این با جداسازی مشتریها در معماری چندمستاجری گره خورده است: مصرف هر مشتری باید جدا شمرده و جدا محدود شود.
هزینه را کنار کیفیت بسنجید
کم کردن هزینه به قیمت پاسخ بد، صرفهجویی نیست. هر تغییری در مدل یا زمینه باید با مجموعهی ارزیابی سنجیده شود تا معلوم باشد کیفیت چه تغییری کرده است.
شاخصی که باید دنبال کنید «هزینهی هر پیام» نیست؛ «هزینهی هر نتیجه» است: هر گفتگویی که به پاسخ درست یا فروش رسیده، چقدر تمام شده است.
چیزهایی که باید از روز اول ثبت شوند
- مصرف به تفکیک مشتری، قابلیت و مدل.
- زمان پاسخ.
- موارد خطا و جایگزینی.
- نسبت کششده به کل.
بدون این دادهها، بهینهسازی حدس و گمان است.
جمعبندی
هزینهی هوش مصنوعی یک مسئلهی مالی نیست که بعداً حل شود؛ یک تصمیم معماری است. دروازهی مرکزی، مدل متناسب با کار، زمینهی کوتاه، کش و سقف مصرف، محصول را از «هر چه بیشتر رشد کنیم بیشتر ضرر میدهیم» نجات میدهند.
مطلب مرتبط: هوش مصنوعی در محصول: هسته، نه تزئین.