حالت نقشه‌ی فنی فعال است — تصمیم‌های طراحی این سایت را ببینید

کنترل هزینه‌ی هوش مصنوعی: دروازه‌ی چندمدلی و بودجه‌ی هر گفتگو

در محصول هوش مصنوعی، هر پاسخ هزینه دارد و رشد کاربر می‌تواند به رشد زیان تبدیل شود. دروازه‌ی چندمدلی، انتخاب مدل متناسب با کار، کش و سقف مصرف، هزینه را قابل‌پیش‌بینی می‌کنند.

در نرم‌افزار معمولی، هزینه‌ی سرویس دادن به کاربر هزارم با کاربر اول تفاوت چندانی ندارد. در محصول هوش مصنوعی این‌طور نیست: هر پیام، هر پاسخ و هر سند پردازش‌شده هزینه‌ی مستقیم دارد.

اگر این هزینه از ابتدا در طراحی دیده نشود، روزی می‌رسد که هر مشتری جدید، حاشیه‌ی سود را کوچک‌تر می‌کند.

هزینه از کجا می‌آید

هزینه‌ی مدل‌های زبانی بر اساس حجم متن ورودی و خروجی حساب می‌شود. سه چیز آن را بالا می‌برد:

  • زمینه‌ی طولانی. هر بار که کل تاریخچه‌ی گفتگو و ده سند را برای مدل می‌فرستید، برای همه‌اش پول می‌دهید.
  • مدل بزرگ برای کار کوچک. استفاده از قوی‌ترین مدل برای تشخیص اینکه پیام «سلام» است.
  • تکرار. پاسخ دادن چندباره به پرسش یکسان.

دروازه‌ی چندمدلی

اولین قدم این است که محصول مستقیماً به یک ارائه‌دهنده وابسته نباشد. همه‌ی درخواست‌ها از یک لایه‌ی مرکزی عبور می‌کنند که من آن را دروازه می‌نامم.

این همان الگوی لایه‌های قابل‌تعویض است که برای مدل‌ها به کار رفته. دروازه چند کار را در یک نقطه انجام می‌دهد:

  • انتخاب مدل بر اساس نوع کار.
  • شمارش مصرف به تفکیک مشتری و قابلیت.
  • اعمال سقف و جلوگیری از مصرف غیرعادی.
  • جایگزینی وقتی یک ارائه‌دهنده در دسترس نیست.
  • ثبت برای بررسی کیفیت و هزینه.

بدون این لایه، هر کدام از این کارها باید در ده جای کد تکرار شود.

مدل متناسب با کار

همه‌ی کارها به قوی‌ترین مدل نیاز ندارند. یک تقسیم‌بندی عملی:

نوع کارمدل مناسب
دسته‌بندی، تشخیص نیت، استخراج سادهمدل کوچک و سریع
پاسخ‌گویی معمول از روی دانش مشخصمدل میان‌رده
استدلال چندمرحله‌ای، تحلیل سند پیچیدهمدل قوی

در یک دستیار فروش، بخش بزرگی از پیام‌ها ساده‌اند. اگر این‌ها به مدل کوچک بروند و فقط موارد سخت به مدل قوی برسند، هزینه به شکل چشمگیری پایین می‌آید بدون اینکه کیفیت در موارد مهم افت کند.

کوتاه کردن زمینه

  • فقط اطلاعات مرتبط را بفرستید. به جای کل کاتالوگ، همان چند محصولی که به پرسش ربط دارند.
  • تاریخچه را خلاصه کنید. در گفتگوی طولانی، پیام‌های قدیمی را خلاصه نگه دارید.
  • دستورالعمل را فشرده بنویسید. متن ثابتی که با هر درخواست فرستاده می‌شود، هزاران بار تکرار می‌شود.

کش

پرسش‌های پرتکرار پاسخ‌های مشابه دارند. ذخیره‌ی پاسخ برای پرسش‌های یکسان یا بسیار نزدیک، هم هزینه را کم می‌کند و هم سرعت را بالا می‌برد. فقط باید مراقب بود که پاسخ کش‌شده برای داده‌ای که عوض شده، مثل قیمت و موجودی، معتبر بماند.

سقف و بودجه

در محصول SaaS، هر مشتری باید بودجه‌ی مشخصی داشته باشد:

  • سقف متناسب با طرح اشتراک. مصرف باید با درآمد از آن مشتری تناسب داشته باشد.
  • هشدار پیش از رسیدن به سقف. نه قطع ناگهانی.
  • رفتار مشخص بعد از سقف. مثلاً محدود شدن به مدل ارزان‌تر یا سپردن به اپراتور انسانی.
  • تشخیص مصرف غیرعادی. یک حلقه‌ی معیوب یا سوءاستفاده نباید یک‌شبه بودجه را تمام کند.

این با جداسازی مشتری‌ها در معماری چندمستاجری گره خورده است: مصرف هر مشتری باید جدا شمرده و جدا محدود شود.

هزینه را کنار کیفیت بسنجید

کم کردن هزینه به قیمت پاسخ بد، صرفه‌جویی نیست. هر تغییری در مدل یا زمینه باید با مجموعه‌ی ارزیابی سنجیده شود تا معلوم باشد کیفیت چه تغییری کرده است.

شاخصی که باید دنبال کنید «هزینه‌ی هر پیام» نیست؛ «هزینه‌ی هر نتیجه» است: هر گفتگویی که به پاسخ درست یا فروش رسیده، چقدر تمام شده است.

چیزهایی که باید از روز اول ثبت شوند

  • مصرف به تفکیک مشتری، قابلیت و مدل.
  • زمان پاسخ.
  • موارد خطا و جایگزینی.
  • نسبت کش‌شده به کل.

بدون این داده‌ها، بهینه‌سازی حدس و گمان است.

جمع‌بندی

هزینه‌ی هوش مصنوعی یک مسئله‌ی مالی نیست که بعداً حل شود؛ یک تصمیم معماری است. دروازه‌ی مرکزی، مدل متناسب با کار، زمینه‌ی کوتاه، کش و سقف مصرف، محصول را از «هر چه بیشتر رشد کنیم بیشتر ضرر می‌دهیم» نجات می‌دهند.

مطلب مرتبط: هوش مصنوعی در محصول: هسته، نه تزئین.

نویسنده

محمد علی اسلامی‌پور

محمد علی اسلامی‌پور معمار محصول دیجیتال است؛ محصولات هوش مصنوعی، SaaS و اپ‌های وب را از تعریف مسئله و معماری سامانه تا انتشار، همراه تیم توسعه‌ی خودش هدایت می‌کند.