بیانیه حفظ حریم خصوصی: حریم خصوصی شما برای ما بسیار مهم است. شرکت ما قول می دهد که اطلاعات شخصی شما را برای هرگونه مجوزهای صریح خود برای هرگونه گسترش فاش نکند.
Select Language
English
از خرج کردن بیش از حد بر روی هوش مصنوعی آهسته و با منابع فشرده خودداری کنید. مدلهای ترانسفورماتور با کارایی بالا ما طوری مهندسی شدهاند که نتایج سریعتری ارائه میکنند و در عین حال از منابع محاسباتی کمتری استفاده میکنند و به کسبوکارها کمک میکنند تا هزینههای هوش مصنوعی را تا 30 درصد کاهش دهند. بهبود کارایی، سرعت بخشیدن به گردش کار، و دستیابی به عملکرد قابل اعتماد بدون به خطر انداختن کیفیت - باعث می شود هوش مصنوعی پیشرفته برای برنامه های مدرن مقرون به صرفه تر و مقیاس پذیرتر شود.
هر درخواست هوش مصنوعی هزینه ای دارد. وقتی پاسخ یک مدل بیشتر طول میکشد، صورتحساب ابری شما با هر درخواستی افزایش مییابد. این تاخیر همچنین بر پشتیبانی مشتری، پردازش اسناد، جستجو و سایر گردشهای کاری روزانه تأثیر میگذارد. مدلی که در حجم کم مقرون به صرفه به نظر می رسد ممکن است با افزایش استفاده گران شود. من اغلب این الگو را می بینم: تیم ها یک مدل بزرگ را برای هر کار انتخاب می کنند، حتی زمانی که یک ترانسفورماتور کوچکتر می تواند نتیجه مورد نیاز را با محاسبه کمتر ارائه دهد. مدلهای مبتنی بر ترانسفورماتور ما برای کاهش کار مورد نیاز برای کارهای رایج هوش مصنوعی طراحی شدهاند. بسته به مدل، حجم کار، طول ورودی و تنظیم سرویس، برخی از تیمها ممکن است هزینههای استنتاج را تا 30 درصد کاهش دهند و در عین حال کیفیت خروجی را برای موارد استفاده خود مناسب نگه دارند. این عدد وعده ای برای هر پروژه نیست. این یک معیار عملی برای آزمایش در برابر ترافیک و اهداف کیفی شماست. در اینجا نحوه عملکرد این رویکرد آمده است. مدل را با کار تطبیق دهید هر درخواستی به یک مدل همه منظوره بزرگ نیاز ندارد. یک سیستم پشتیبانی که بلیط ها را طبقه بندی می کند، جزئیات سفارش را استخراج می کند یا زبان را تشخیص می دهد ممکن است با یک ترانسفورماتور کوچکتر به خوبی کار کند. یک مدل بزرگتر می تواند برای درخواست هایی که نیاز به استدلال عمیق تر یا پاسخ های طولانی تر دارند در دسترس باقی بماند. این تقسیم به کاهش محاسبات غیر ضروری کمک می کند. همچنین اندازه گیری رفتار سیستم را آسان تر می کند. کاهش پردازش مکرر بسیاری از برنامه ها با هر درخواست، زمینه یکسانی را ارسال می کنند. جزئیات محصول، متن خطمشی و اطلاعات حساب ممکن است بارها و بارها اضافه شوند، حتی زمانی که تنها بخش کوچکی تغییر کرده باشد. یک راهاندازی بهتر میتواند از اعلانهای کوتاهتر، زمینه قابل استفاده مجدد، ورودیهای ساختاریافته یا نتایج ذخیرهشده در جایی که وظیفه اجازه میدهد استفاده کند. نشانههای ورودی کمتر معمولاً به معنای زمان پردازش کمتر و هزینههای استفاده کمتر است. بیشتر از سرعت پاسخ اندازه گیری کنید خروجی سریع مفید است، اما سرعت به تنهایی نشان نمی دهد که آیا یک مدل مناسب است یا خیر. من ردیابی را توصیه میکنم: - هزینه هر درخواست - میانگین و زمان اوج پاسخ - استفاده از نشانه ورودی و خروجی - نرخ خطا و تلاش مجدد - دقت کار - زمان بررسی انسانی - تغییرات کیفیت پس از فشردهسازی یا مسیریابی مدل مدلی که در هزینه صرفهجویی میکند اما کار دستی بیشتری ایجاد میکند، ممکن است هزینه کل گردش کار را کاهش ندهد. از مسیریابی به جای یک مدل برای همه استفاده کنید یک لایه مسیریابی ساده می تواند درخواست های آسان را به مدل کوچکتر ارسال کند و مدل های بزرگتر را برای مواردی که به ظرفیت بیشتری نیاز دارند رزرو کند. به عنوان مثال، یک خرده فروش آنلاین ممکن است از یک ترانسفورماتور فشرده برای شناسایی سؤالات وضعیت سفارش استفاده کند. درخواستهای مربوط به بازپرداخت، استثنائات خطمشی یا زبان مشتری نامشخص میتوانند برای بررسی به مدل بزرگتری منتقل شوند. این طرح به هر درخواست، سطح پردازش مورد نیاز را می دهد. با داده های خود تست کنید معیارهای عمومی می توانند به مقایسه اولیه کمک کنند، اما آنها جایگزین تست های مبتنی بر ترافیک شما نمی شوند. یک مجموعه ارزیابی مفید ممکن است شامل موارد زیر باشد: - سوالات متداول کاربر - ورودی های طولانی و کوتاه - غلط املایی - زبان های ترکیبی - موارد لبه - درخواست هایی که نیاز به بررسی انسانی دارند همان مجموعه را از طریق مدل فعلی خود و گزینه کم هزینه اجرا کنید. کیفیت، سرعت و هزینه کل عملیات را مقایسه کنید. صرفه جویی 30 درصدی تنها زمانی مفید است که نتیجه همچنان با نیازهای خدمات شما مطابقت داشته باشد. یک تیم پردازش اسناد را در نظر بگیرید که هر روز فاکتورها را رسیدگی می کند. مدل موجود آن ممکن است هر صفحه را با همان سطح پردازش بخواند. یک ترانسفورماتور کوچکتر می تواند اسامی تامین کنندگان، تاریخ ها و مجموع را استخراج کند، در حالی که اسناد غیر معمول به مدل بزرگتر یا بازبینی کننده انسانی منتقل می شوند. تیم ممکن است استفاده از محاسبات را بدون تغییر در روند بررسی فایلهای دشوار کاهش دهد. بهترین نتیجه از سیستمی حاصل می شود که می داند چه زمانی از یک مدل کوچکتر استفاده کند، چه زمانی درخواست پردازش بیشتری کند و چه زمانی یک شخص را درگیر کند. راهحلهای ترانسفورماتور ما میتوانند از این فرآیند با انتخاب مدل، آزمایش حجم کاری و ردیابی هزینه پشتیبانی کنند. شما می توانید با یک گردش کار شروع کنید، نتایج را مقایسه کنید و تنها زمانی گسترش دهید که داده ها از تغییر پشتیبانی کنند. هزینه های کمتر هوش مصنوعی از انتخاب کوچکترین مدل برای هر درخواست ناشی نمی شود. آنها از استفاده از مدل مناسب، محدود کردن کارهای مکرر و اندازهگیری گردش کار کامل ناشی میشوند.
هوش مصنوعی می تواند جستجو، پشتیبانی، بررسی اسناد و خدمات مشتری را سرعت بخشد. همچنین می تواند صورتحساب های ابر را سریعتر از حد انتظار افزایش دهد. من همین الگو را در بسیاری از پروژههای هوش مصنوعی دیدهام: یک تیم با یک مدل ترانسفورماتور بزرگ شروع میکند، هر درخواستی را از طریق آن ارسال میکند و برای ظرفیت استفادهنشده، درخواستهای مکرر، خروجیهای طولانی و زمان GPU بیکار پرداخت میکند. مدل کار می کند، اما هزینه با ارزش هر درخواست مطابقت ندارد. یک راهاندازی هوشمندتر میتواند هزینهها را تا 30 درصد در برخی از حجمهای کاری کاهش دهد. نتیجه دقیق به ترافیک، اندازه مدل، سخت افزار، طول سریع و کیفیت کار بهینه سازی بستگی دارد. در اینجا نحوه برخورد من با آن است. ### 1. اندازه گیری هزینه فعلی من با یک تصویر هزینه روشن شروع به جای تغییر مدل به طور تصادفی. بررسی میکنم: - هزینه به ازای هر درخواست - نشانههای مورد استفاده برای ورودی و خروجی - استفاده از GPU یا CPU - میانگین زمان پاسخ - اوج ترافیک - ظرفیت بیکار - درخواستهایی که نتایج کمارزش را برمیگردانند - درخواستهای مکرر و درخواستهای تکراری یک گزارش ساده میتواند نشان دهد که پول کجا میرود. به عنوان مثال، یک دستیار پشتیبانی ممکن است برای درخواست های طولانی بیشتر از خود پاسخ هزینه کند. این درخواست ممکن است شامل همان خطمشی شرکت، فهرست محصول و دستورالعملهای حساب در هر درخواست باشد. این داده ها به من یک هدف کار می دهد. بدون آن، صورتحساب کمتری ممکن است با پاسخهای کندتر یا کیفیت پایینتر همراه باشد. ### 2. هر کار را با مدل مناسب مطابقت دهید یک مدل ترانسفورماتور بزرگ برای کارهای دشوار مفید است، اما بسیاری از درخواست های روزانه نیازی به ظرفیت کامل آن ندارند. من میتوانم درخواستهای ساده را به یک مدل کوچکتر هدایت کنم: - بررسی وضعیت سفارش - جستجوهای دستهبندی محصولات - طبقهبندی متن کوتاه - تشخیص زبان - پر کردن فرم اصلی - سوالات مکرر مشتری مدل بزرگتر میتواند کارهایی را که نیاز به استدلال عمیقتری دارند، مانند تجزیه و تحلیل سند پیچیده یا موارد پشتیبانی چند مرحلهای، انجام دهد. این رویکرد مسیریابی مدل، کیفیت را در جایی که اهمیت دارد حفظ میکند و تعداد تماسهای گران قیمت را کاهش میدهد. یک درخواست برای هر مرحله به یک مدل نیاز ندارد. ### 3. اندازه درخواست را کاهش دهید درخواست های طولانی استفاده از رمز را افزایش می دهند. آنها همچنین می توانند سیستم را کندتر کنند. من درخواست را بررسی میکنم و حذف میکنم: - دستورالعملهای مکرر - نمونههای قدیمی - جزئیات محصول استفاده نشده - متن خطمشی تکراری - زمینهای که روی پاسخ تأثیری ندارد من قوانینی را حفظ میکنم که مدل را هدایت میکنند و اطلاعات پایدار را به یک سیستم بازیابی بهتر منتقل میکنند. هدف کوتاه کردن هر اعلان نیست. هدف این است که هر نشانه مفیدی باشد. یک ربات پشتیبانی مشتری ممکن است قبل از پاسخ دادن به سوالی که فقط به 500 عدد نیاز دارد، 4000 توکن دریافت کند. کاهش این ورودی به 2000 توکن میتواند هزینه هر درخواست را بدون تغییر تجربه کاربر کاهش دهد. ### 4. از حافظه پنهان برای کارهای مکرر استفاده کنید بسیاری از سیستم های هوش مصنوعی سوالات مشابهی را در طول روز دریافت می کنند. یک کش می تواند پاسخ درخواست هایی را که دارای هدف و اطلاعات پایدار هستند ذخیره کند. این می تواند در موارد زیر کمک کند: - سوالات خط مشی حمل و نقل - ساعات اداری - مشخصات محصول - راهنماهای فرآیند داخلی - دستورالعمل های فنی رایج اطلاعات پویا هنوز نیاز به جستجوی تازه دارند. تخمین تحویل، موجودی حساب یا تعداد سهام نباید به یک پاسخ ذخیره شده قدیمی متکی باشد. من حافظه پنهان را به عنوان یک ویژگی کیفی و همچنین یک ابزار هزینه در نظر میگیرم. قوانین کش باید شامل یک زمان انقضا و روشی برای تازه کردن اطلاعات در هنگام تغییر منبع باشد. ### 5. کنترل طول خروجی برخی از مدل ها پاسخ های طولانی تر از نیاز کاربران تولید می کنند. کلمات اضافی نشانه ها را مصرف می کنند و زمان پاسخ را افزایش می دهند. من محدودیتهای خروجی عملی را بر اساس وظیفه تعیین میکنم: - یک جمله برای برچسب - یک پاراگراف کوتاه برای پاسخ پشتیبانی - یک لیست ساختاریافته برای مقایسه محصول - پاسخ طولانیتر فقط زمانی که کاربر جزئیات را بخواهد این به معنای اجبار کردن هر پاسخ به یک قالب نیست. یک سیستم خوب به مدل فضای کافی برای تکمیل کار می دهد و در عین حال از تکرار غیر ضروری جلوگیری می کند. ### 6. بهبود بهره وری خدمات این مدل تنها بخشی از صورتحساب است. نحوه اجرای آن نیز مهم است. من بررسی میکنم: - اندازه دسته - تنظیمات Quantization - استفاده از GPU - قوانین مقیاس خودکار - استفاده از حافظه - صفهای درخواست - زمان شروع سرد - ظرفیت در دورههای کم ترافیک Quantization میتواند نیازهای حافظه را کاهش دهد، اما باید در برابر وظایف واقعی آزمایش شود. یک افت کیفیت کوچک ممکن است برای طبقه بندی قابل قبول و برای بررسی قانونی یا پزشکی نامناسب باشد. انتخاب مناسب به مورد استفاده و روند بررسی بستگی دارد. مقیاس خودکار می تواند به سیستم کمک کند ظرفیت را با تقاضا مطابقت دهد. سرویسی که در ساعات خلوت با ظرفیت کامل اجرا میشود ممکن است برای منابعی که هیچکس استفاده نمیکند، هزینه پرداخت کند. ### 7. ردیابی کیفیت در کنار هزینه اگر سیستم خطاهای بیشتری ایجاد کند، صورتحساب کمتر نتیجه مفیدی نیست. من هزینه را به همراه موارد زیر دنبال میکنم: - نرخ پاسخ صحیح - نرخ بازبینی انسانی - رضایت کاربر - زمان پاسخ - درخواستهای ناموفق - افزایش به کارکنان پشتیبانی - گزارشهای توهم من همچنین یک مجموعه آزمایشی با نمونههای واقعی و ناشناس از محصول نگه میدارم. هر مدل یا تغییر سریع در برابر آن مجموعه قبل از انتشار اجرا می شود. یک گزارش هزینه ممکن است کاهش 30٪ را نشان دهد، در حالی که یک گزارش کیفیت نشان می دهد که پاسخ های مهم کمتر قابل اعتماد هستند. این یک پیشرفت کامل نیست. سیستم نیاز به تنظیم دیگری دارد. ### یک مثال هزینه عملی یک سرویس پشتیبانی هوش مصنوعی را تصور کنید که هر ماه 100000 درخواست را رسیدگی می کند. تیم دریافت که: - 40٪ درخواست ها ساده هستند - 25٪ حاوی محتوای درخواستی مکرر هستند - 15٪ می توانند از پاسخ های حافظه پنهان استفاده کنند - ظرفیت GPU در بخشی از روز بیکار می ماند. تیم درخواست های ساده را به یک مدل کوچکتر هدایت می کند، درخواست های مکرر را کوتاه می کند، حافظه پنهان ایمن را اضافه می کند و ظرفیت را برای مطابقت با تقاضا تنظیم می کند. اگر صورتحساب ماهانه از 10000 دلار به 7000 دلار کاهش یابد، پس انداز 30 درصد است. این مثال بر اساس حجم کاری احتمالی است، نه یک وعده برای هر تجارت. پس انداز واقعی باید پس از استقرار اندازه گیری شود. ### یک طرح عرضه ایمن تر من تغییرات کوچک قابل اندازه گیری را ترجیح می دهم. 1. ثبت هزینه و کیفیت فعلی. 2. یک گردش کار با حجم بالا را انتخاب کنید. 3. یک مدل کوچکتر یا دستور کوتاهتر را تست کنید. 4. هزینه، سرعت و کیفیت پاسخ را مقایسه کنید. 5. تغییر را به سهم محدودی از ترافیک آزاد کنید. 6. بررسی خطاها و بازخورد کاربران. 7. هنگامی که داده ها از آن پشتیبانی می کنند، تغییر را گسترش دهید. این فرآیند به جلوگیری از یک اشتباه رایج کمک می کند: تغییر چندین قسمت از سیستم به طور همزمان و از دست دادن مسیری که باعث نتیجه شده است. بهترین برنامه هزینه هوش مصنوعی انتخاب کوچکترین مدل یا کاهش هر پاسخ نیست. این در مورد ارسال درخواست مناسب به مدل مناسب، تنها با استفاده از زمینه ای که مهم است و بررسی کیفیت در هر مرحله است. با اندازهگیری واضح و آزمایش دقیق، تیمها ممکن است هزینههای ترانسفورماتور را تا 30 درصد در حجم کاری مناسب کاهش دهند و در عین حال خدمات را برای افرادی که به آن متکی هستند مفید نگه دارند.
هزینه های هوش مصنوعی می تواند بی سر و صدا افزایش یابد. یک تیم اعلانهای بیشتری اضافه میکند، تاریخچه کامل چت را ارسال میکند، از یک مدل بزرگ برای هر کار استفاده میکند و رشد صورتحساب ماهانه را تماشا میکند. در عین حال، کاربران همچنان منتظر پاسخ های سریع هستند. من متوجه شده ام که مشکل اصلی به ندرت یک درخواست گران است. هزینه معمولاً از انتخاب های کوچکی که در هزاران درخواست تکرار می شود ناشی می شود. کاهش 30 درصدی می تواند برای برخی تیم ها بدون کاهش تجربه کاربر امکان پذیر باشد. نتیجه به ترافیک، قیمت مدل، اندازه سریع و نحوه رسیدگی سیستم به درخواست ها بستگی دارد. هیچ پس انداز ثابتی برای هر کسب و کاری وجود ندارد. من با یک بررسی هزینه ساده شروع می کنم. این اعداد را حداقل برای یک چرخه صورتحساب دنبال کنید: - کل درخواستها - میانگین نشانههای ورودی - میانگین نشانههای خروجی - هزینه هر مدل - زمان پاسخ - نرخ خطا و تلاش مجدد - درخواستهایی که نیاز به مدلی با قابلیت بالا دارند - درخواستهایی که میتوانند از مدل کوچکتری استفاده کنند. بسیاری از تیم ها متوجه می شوند که گروه کوچکی از کارهای تکراری بیشتر هزینه را ایجاد می کند. یک مثال مفید یک دستیار پشتیبانی است که هر ماه 12000 درخواست را رسیدگی می کند. سیستم هر سوالی را به یک مدل بزرگ ارسال می کند. هر درخواست شامل تاریخچه کامل مشتری، راهنمای محصول و دستورالعمل های داخلی است. هزینه متوسط درخواست حدود 0.08 دلار است که یک مدل صورتحساب ماهانه تقریباً 960 دلار ایجاد می کند. یک بررسی عملی ممکن است نشان دهد که: - 55٪ سؤالات مربوط به پرس و جوهای ساده حساب یا محصول هستند - 25٪ به جستجوی سند نیاز دارند - 15٪ نیاز به پاسخ دقیق دارند - 5٪ نیاز به بررسی انسانی دارند ارسال همه 12000 درخواست به یک مدل به ندرت ضروری است. من ترافیک را بر اساس وظیفه جدا می کنم. یک مدل کوچکتر می تواند سوالات کوتاهی مانند: - "چگونه رمز عبور خود را بازنشانی کنم؟" - "از کجا می توانم فاکتور خود را پیدا کنم؟" - "چه نوع فایلی را قبول دارید؟" یک مدل قوی تر می تواند اسناد طولانی، درخواست های نامشخص و استدلال چند مرحله ای را مدیریت کند. انسان می تواند موارد حساس یا غیرعادی را بررسی کند. این مسیریابی مدل می تواند هزینه را کاهش دهد و در عین حال سطح خدمات مشابهی را برای درخواست های پیچیده حفظ کند. من یک مدل را تنها بر اساس قیمت قضاوت نمی کنم. من کیفیت پاسخ، زمان پاسخ، و تعداد تکرارهای ایجاد شده را مقایسه می کنم. اندازه سریع نیز بر صورتحساب تأثیر می گذارد. بسیاری از سیستم ها همان بلوک دستورالعمل بزرگ را به هر درخواست متصل می کنند. من این مطالب را با موارد زیر کاهش میدهم: - حذف قوانین مکرر - انتقال اطلاعات ثابت به یک پایگاه دانش قابل جستجو - ارسال فقط بخش سند مربوطه - حفظ سابقه مشتری در محدوده مفید - جایگزینی مثالهای طولانی با مثالهای کوتاه - جداسازی دستورالعملهای سیستم از دادههای کار یک اعلان کوتاهتر همچنین میتواند زمان پاسخگویی را بهبود بخشد زیرا مدل محتوای کمتری برای پردازش دارد. هدف حذف زمینه مفید نیست. هدف حذف زمینه ای است که به پاسخ سوال فعلی کمک نمی کند. حافظه پنهان می تواند درخواست های مکرر را مدیریت کند. اگر بسیاری از کاربران سؤال یکسانی از محصول را بپرسند، سیستم نیازی به ایجاد یک پاسخ تازه در هر بار ندارد. من پاسخهای تأیید شده را برای سؤالات پایدار ذخیره میکنم و برای اطلاعاتی که ممکن است تغییر کند یک دوره بازبینی تعیین میکنم. به عنوان مثال، سیاست حمل و نقل ممکن است برای چندین هفته بدون تغییر باقی بماند. قیمت محصول ممکن است هر روز تغییر کند. این دو نوع اطلاعات به تنظیمات کش متفاوت نیاز دارند. همچنین زمانی که چندین درخواست در یک منبع جستجو می کنند، نتایج اسناد مشترک را در حافظه پنهان نگه می دارم. این کار تکراری را کاهش می دهد در حالی که اجازه می دهد پاسخ نهایی با سؤال کاربر مطابقت داشته باشد. دستهبندی به کارهایی که نیازی به پاسخ فوری ندارند کمک میکند. ایجاد گزارش، برچسبگذاری ایمیل، برچسبگذاری اسناد و پاکسازی دادهها اغلب میتوانند در گروه اجرا شوند. یک تیم میتواند این وظایف را جمعآوری کند و به جای ارسال هر آیتم بهعنوان یک درخواست زنده جداگانه، آنها را در فواصل زمانی مشخص پردازش کند. این رویکرد برای چت زنده مناسب نیست. این می تواند برای کارهای پس زمینه که در آن تاخیر کوتاه بر مشتری تأثیر نمی گذارد، مناسب باشد. تلاش های مجدد مستحق توجه دقیق است. یک درخواست ناموفق ممکن است دوباره دو یا سه بار ارسال شود. این هزینه را افزایش می دهد و می تواند سیستم را کندتر کند. من دلیل هر تلاش مجدد را بررسی میکنم: - خطای شبکه موقت - درخواست مهلت زمانی - فرمت پاسخ نامعتبر - پاسخ فیلتر محتوا - خرابی ابزار - طراحی سریع ضعیف محدودیت تلاش مجدد، مدیریت خطا واضح و خروجی ساختاریافته میتواند از تماسهای مکرر جلوگیری کند. وقتی مشکل واقعی یک ابزار خراب یا داده های نامعتبر است، سیستم نباید مدام از همان مدل برای پاسخ یکسان بپرسد. هنگامی که گردش کار ساده تر باشد، سرعت و هزینه اغلب با هم بهبود می یابند. تماس های غیرضروری مانند: 1. طبقه بندی درخواست با یک مدل 2. بازنویسی آن با مدل دوم 3. جستجوی اسناد با تماس سوم 4. ایجاد پاسخ با تماس چهارم برخی از کارها به چندین مرحله نیاز دارند. برخی نمی کنند. من آزمایش می کنم که آیا دو تماس می توانند جایگزین چهار تماس شوند بدون اینکه کیفیت پاسخ را کاهش دهند. یک فرآیند آزمایش عملی به این صورت است: - انتخاب 100 تا 300 درخواست نماینده - ثبت هزینه فعلی و زمان پاسخ - ایجاد یک گردش کاری با هزینه کمتر - مقایسه دقت پاسخ و رضایت کاربر - بررسی موارد لبه و درخواست های حساس - ارائه تغییر به یک گروه ترافیک کوچک - بررسی نتایج قبل از استفاده گسترده تر در طول آزمایش گزینه بازگشت را نگه می دارم. کنترل هزینه نباید مشکل پشتیبانی جدیدی ایجاد کند. کاهش نمونه ممکن است به این صورت باشد: - مسیریابی مدل: 15٪ هزینه کمتر - اعلان های کوتاهتر: 8٪ هزینه کمتر - ذخیره پاسخ های مکرر: 5٪ هزینه کمتر - تکرارهای کمتر: 3٪ هزینه کمتر این ارقام نمونه هستند، نه یک وعده. پس انداز هر تغییر ممکن است همپوشانی داشته باشد، بنابراین من کل را پس از آزمایش به جای جمع کردن هر درصد با هم محاسبه می کنم. تیم همچنین نیاز به بررسی کیفیت دارد. من نظارت می کنم: - صحت - اطلاعات از دست رفته - لحن - زمان پاسخ - میزان افزایش - شکایات مشتری - نتایج بررسی انسانی پاسخ ارزان تر که بلیط های پشتیبانی بیشتری ایجاد می کند صرفه جویی واقعی نیست. من کاهش اندازهگیری شده با خدمات پایدار را به یک کاهش بزرگ که به اعتماد آسیب میزند ترجیح میدهم. دیدگاه من ساده است: کنترل هزینه هوش مصنوعی زمانی بهترین عملکرد را دارد که با تجزیه و تحلیل ترافیک شروع شود، نه با سوئیچ مدل عجولانه. از یک مدل کوچکتر در جایی که وظیفه اجازه می دهد استفاده کنید، اعلان ها را متمرکز نگه دارید، از نتایج پایدار استفاده مجدد کنید و برای درخواست هایی که واقعاً به آن نیاز دارند، پردازش با هزینه بالاتر را رزرو کنید. این رویکرد به تیم مسیر روشنی برای کاهش هزینهها میدهد و در عین حال سرعت و کیفیت پاسخ را تحت بررسی نگه میدارد.
بسیاری از تیمها بدون تماشای افزایش صورتحسابهای API با هر درخواست، نتایج هوش مصنوعی قویتری میخواهند. مسئله اغلب این نیست که یک شرکت چقدر از هوش مصنوعی استفاده می کند. این است که چگونه هر کار به یک مدل اختصاص داده می شود. یک طرح مسیریابی مدل ساده می تواند به کنترل هزینه های هوش مصنوعی و در عین حال ثابت نگه داشتن کیفیت کمک کند. من کارهای پیچیده را به مدلی با قابلیت بالا می فرستم و کارهای روتین را به گزینه ای با هزینه کمتر هدایت می کنم. این می تواند هزینه های هدر رفته را کاهش دهد و برخی از تیم ها ممکن است بسته به الگوهای استفاده، نزدیک به 30 درصد پس انداز داشته باشند. ## مشکل هزینه یک مدل واحد اغلب برای هر درخواست استفاده میشود: - مرتبسازی پیام مشتری - پیشنویسهای توضیحات محصول - استخراج دادهها - بررسی کد - خلاصههای تحقیقاتی - تجزیه و تحلیل پیچیده کسبوکار این وظایف به همان سطح پردازش نیاز ندارند. یک درخواست طبقه بندی کوتاه ممکن است با یک مدل کوچکتر به خوبی کار کند. بررسی سند قانونی یا تجزیه و تحلیل فنی دقیق ممکن است به مدل قوی تری نیاز داشته باشد. هنگامی که هر درخواستی به همان مدل گران قیمت می رود، شرکت ممکن است برای ظرفیتی بیش از نیاز کار بپردازد. ## حرکت هوشمند: مسیریابی وظایف بر اساس سختی من از یک ساختار سه سطحی ساده استفاده می کنم. ### وظایف روتین اینها عبارتند از: - مرتب سازی بلیط های پشتیبانی - تشخیص هدف پیام - استخراج نام ها، تاریخ ها و شماره های سفارش - بازنویسی متن کوتاه - ایجاد برچسب های محصول ساده یک مدل کم هزینه اغلب می تواند این کار را زمانی که فرمت درخواست و خروجی واضح است انجام دهد. ### وظایف استاندارد اینها عبارتند از: - نوشتن پاسخ های مشتری - خلاصه کردن گزارش ها - ایجاد پیش نویس های کمپین - مقایسه ویژگی های محصول - ایجاد یادداشت های داخلی یک مدل میان رده ممکن است تعادل خوبی بین هزینه و کیفیت خروجی ایجاد کند. ### وظایف پیچیده عبارتند از: - تجزیه و تحلیل چند مرحله ای - برنامه ریزی فنی - بررسی اسناد طولانی - اشکال زدایی کد - تصمیمات تجاری که به زمینه بیشتری نیاز دارند این درخواست ها را می توان به مدلی توانمندتر ارسال کرد. هدف اجتناب از مدل های قوی تر نیست. هدف استفاده از آنها در جایی است که ارزش افزوده دارند. ## یک مثال هزینه عملی تصور کنید یک تیم پشتیبانی هر ماه 100000 درخواست هوش مصنوعی ارسال می کند. حدود 70000 درخواست فقط پیام ها را طبقه بندی می کنند یا جزئیات اولیه را استخراج می کنند. 30000 باقیمانده نیاز به پاسخ های طولانی تر یا تجزیه و تحلیل عمیق تر دارند. اگر همه درخواستها از مدل پرهزینه استفاده کنند، صورتحساب ماهانه ممکن است بزرگتر از نیاز باشد. این تیم میتواند این تنظیمات را آزمایش کند: 1. درخواستهای اساسی را به یک مدل کمهزینه هدایت کند. 2. درخواست های استاندارد را در یک مدل میان رده نگه دارید. 3. درخواست های پیچیده را به مدل قوی تر ارسال کنید. 4. نمونه ای از خروجی ها را هر هفته مرور کنید. 5. هنگامی که کیفیت تغییر می کند، وظایف را بین گروه ها جابه جا کنید. اگر هزینه اصلی ماهانه 10000 دلار باشد، کاهش 30 درصدی آن را به حدود 7000 دلار می رساند. نتیجه واقعی به حجم توکن، قیمت مدل، طول سریع، طول خروجی و تعداد درخواستهایی که نیاز به پردازش قویتری دارند بستگی دارد. پس انداز باید اندازه گیری شود، نه فرض. ## چگونه مسیریابی مدل را تنظیم میکنم ### حجم کار فعلی را نقشهبرداری میکنم. من یک یا دو هفته از دادههای درخواست را جمعآوری میکنم و ثبت میکنم: - نوع درخواست - طول ورودی - طول خروجی - مدل استفاده شده - زمان پاسخ - نرخ خطا - نرخ تصحیح انسانی - هزینه هر درخواست این نشان میدهد که بودجه به کجا میرود. یک تیم ممکن است متوجه شود که درخواستهای کوتاه و تکراری بیشتر استفاده از آن را تشکیل میدهند. ### قوانین مسیریابی واضح ایجاد کنید قوانین میتوانند ساده بمانند: - درخواست طبقهبندی کوتاه ← مدل کمهزینه - درخواست نوشتن استاندارد ← مدل میانرده - درخواست تحلیل پیچیده ← مدل قویتر - پاسخ کماعتماد ← ارسال به یک مدل قویتر یا بازبینیکننده انسانی. ### کیفیت خروجی تست کنترل هزینه نباید کیفیت خدمات مشتری را کاهش دهد. من پاسخهای مدلهای مختلف را با مجموعهای از درخواستها مقایسه میکنم. بررسی میتواند موارد زیر را بررسی کند: - دقت - لحن - کامل بودن - قالببندی - انطباق با خطمشی - زمان ویرایش انسانی پاسخ ارزانتری که نیاز به تصحیح شدید دارد ممکن است صرفهجویی واقعی ایجاد نکند. ### اعداد مناسب را ردیابی کنید یک داشبورد مفید میتواند نشان دهد: - هزینه به ازای هر 1000 درخواست - میانگین نشانهها برای هر درخواست - هزینه بر اساس نوع کار - نرخ افزایش - زمان تصحیح انسانی - کیفیت پاسخ مشتری این اعداد تصمیمگیری را آسانتر میکنند. اگر یک مدل کمهزینه یک کار را به خوبی انجام دهد و زمان بررسی را کاهش دهد، ممکن است مناسب باشد. اگر نه، کار می تواند به مدل دیگری منتقل شود. ## مثال یک کسب و کار کوچک یک خرده فروش آنلاین پنج نفره از هوش مصنوعی برای پاسخ به سؤالات محصول و سازماندهی پیام های پشتیبانی استفاده کرد. تیم هر درخواستی را به یک مدل ارسال کرد، زیرا مدیریت تنظیمات آسان بود. پس از بررسی دادههای خود، تیم دریافت که بیشتر درخواستها شامل دستهبندی محصول، سؤالات حمل و نقل و جزئیات سفارش است. فقط گروه کوچکتری نیاز به پاسخ دقیق داشتند. خرده فروش سه مسیر ایجاد کرد: - جزئیات اولیه سفارش → مدل ارزان تر - سوالات محصول → مدل میان رده - شکایات و درخواست های پیچیده → مدل قوی تر با بررسی انسانی تیم سپس کیفیت پاسخ را به مدت دو هفته مقایسه کرد. پس از مشاهده هزینه کمتر مدل و عدم افزایش واضح در اصلاحات مشتری، برنامه مسیریابی جدید را حفظ کرد. نتیجه از تطبیق ابزار با کار به دست آمد، نه از حذف ویژگی های هوش مصنوعی. ## اشتباهات رایج برای جلوگیری از استفاده از یک مدل برای هر درخواست می تواند هزینه ها را بدون بهبود نتایج افزایش دهد. ارسال سابقه چت طولانی با هر درخواستی نیز می تواند استفاده از رمز را افزایش دهد. من زمینه استفاده نشده را حذف میکنم، دستورالعملها را متمرکز نگه میدارم و اطلاعات تکراری را در قالبی ساختاریافته ذخیره میکنم. کاهش هزینه ها بدون بررسی کیفیت خطر دیگری ایجاد می کند. یک مدل ممکن است پاسخ ارزان تری ارائه دهد که برای مشتری ناقص، نامشخص یا نامناسب باشد. من همچنین از تغییر چند قسمت سیستم به طور همزمان اجتناب می کنم. وقتی قوانین مدل، درخواست، گردش کار و بررسی با هم تغییر می کنند، تشخیص اینکه چه چیزی باعث نتیجه شده است دشوار می شود. ## یک برنامه ساده برای شروع - 10 کار برتر هوش مصنوعی را بر اساس استفاده ماهانه فهرست کنید. - آنها را بر اساس سختی گروه بندی کنید. - یک مدل کمهزینه را روی کار معمولی آزمایش کنید. - یک نمونه بررسی برای بررسی کیفیت نگه دارید. - هزینه و زمان اصلاح را برای دو هفته پیگیری کنید. - قوانین مسیریابی را بر اساس داده ها تنظیم کنید. کاهش هزینه هوش مصنوعی به خدمات ضعیف تری نیاز ندارد. یک برنامه مسیریابی مبتنی بر وظیفه میتواند به هر درخواست سطح پردازش مورد نیاز را بدهد، در حالی که تیم کنترل کیفیت، حریم خصوصی و هزینهها را حفظ میکند. مفیدترین سوال این نیست که "از کدام مدل برای همه چیز استفاده کنیم؟" این "کدام مدل برای این کار مناسب است؟" می خواهید بیشتر بدانید؟ با امی وو تماس بگیرید: amy.wu@ihuagroup.com/WhatsApp +8613612662976.
Ashish Vaswani، 2017، Attention Is All You Need جارد کاپلان، 2020، قوانین مقیاسبندی برای مدلهای زبان عصبی جردن هافمن، 2022، آموزش مدلهای زبان بزرگ محاسباتی-بهینه، تیم دتمر، 2022، LLM.int8: 8-Transplicationscale 2022، FlashAttention: توجه دقیق سریع و کارآمد حافظه با IO-Awareness Song Han، 2016، فشرده سازی عمیق: فشرده سازی شبکه های عصبی عمیق با هرس کردن، کوانتیزاسیون آموزش دیده و کدگذاری هافمن
September 20, 2026
ارسال به این منبع
September 20, 2026