مدل زبانی ۵.۹ گیگابایتی؛ هوش مصنوعی از ابر به جیب میآید

بحث مدلهای زبانی معمولاً با میلیاردها پارامتر، خوشههای عظیم پردازنده و هزینه سنگین مرکز داده همراه است. PrismML میخواهد این تصویر را وارونه کند. استارتاپی که از دل پژوهشگران کلتک بیرون آمده، مدل Bonsai 2 27B را در حجمی نزدیک به ۵.۹ گیگابایت جا داده است؛ مدلی که نسخه فشرده Qwen3.8 با ۲۷ میلیارد پارامتر محسوب میشود. چنین حجمی روی رایانه شخصی و حتی برخی تلفنهای ردهبالا قابل اجراست و میتواند بخشی از هوش مصنوعی را از ابر به دستگاه کاربر منتقل کند.
شرکت میگوید کاهش حافظه نسبت به مدل اصلی حدود ۹ تا ۱۰ برابر است، در حالی که امتیاز تجمیعی آن در آزمونها به ۹۸ درصد عملکرد نسخه مبنا میرسد. این ادعا اگر در کارهای واقعی نیز تأیید شود، فقط دستاوردی فنی نیست؛ مدل اقتصادی هوش مصنوعی را تغییر میدهد. کاربر به جای ارسال هر درخواست به سرور، میتواند بخشی از پردازش را روی سختافزاری انجام دهد که قبلاً خریده است. هزینه استفاده کاهش مییابد، پاسخ بدون اینترنت ممکن میشود و داده خصوصی لزوماً از دستگاه خارج نمیشود.
چگونه ۲۷ میلیارد پارامتر در چند گیگابایت جا میگیرند؟
وزنهای یک شبکه عصبی را میتوان نوعی حافظه آموختهشده مدل دانست. در بسیاری از مدلها هر وزن با عددی ۱۶ بیتی نگهداری میشود. PrismML از روشی با وزنهای سهحالته استفاده میکند و مقدار هر وزن را به یکی از سه وضعیت مثبت یک، منفی یک یا صفر میرساند. دامنه کوچکتر، فضای ذخیرهسازی و جابهجایی داده را بهشدت کم میکند. پردازنده نیز به جای عملیات عددی پیچیده، میتواند بخش بیشتری از محاسبات را با ساختاری سادهتر انجام دهد.
فشردهسازی معمولاً بهایی دارد. وقتی دقت عددها کاهش مییابد، بخشی از ظرافت مدل از بین میرود و پاسخ ممکن است ضعیفتر شود. هنر کار در این است که مشخص شود کدام وزنها را میتوان ساده کرد و چگونه مدل پس از فشردهسازی دوباره تنظیم شود. نسخه نخست Bonsai که چند ماه پیش منتشر شد، به گفته شرکت ۹۵ درصد امتیاز مدل مرجع را حفظ میکرد. رسیدن نسخه دوم به ۹۸ درصد نشان میدهد روش در فاصله کوتاهی بهتر شده، هرچند آزمون مستقل برای سنجش ادعا ضروری است.
عدد دو درصد افت نیز باید با احتیاط تفسیر شود. بنچمارکها نمونهای محدود از توان مدلاند و خود مدل اصلی هم پاسخ بینقص نمیدهد. در بعضی کارها تفاوت دو درصدی دیده نمیشود، اما در کدنویسی حساس، محاسبه یا زبانی کممنبع ممکن است اثر بیشتری داشته باشد. نرمافزاری که مدل را احاطه میکند، شیوه نوشتن دستور، ابزارهای متصل و روش بازیابی اطلاعات نیز میتوانند نتیجه را بالا یا پایین ببرند. بنابراین «۹۸ درصد» آغاز ارزیابی است، نه پایان آن.
هوش خصوصی و همیشه در دسترس
اجرای محلی برای اسناد محرمانه جذاب است. پزشک، وکیل یا مهندس میتواند متن را پردازش کند بیآنکه فایل کامل به سرویس بیرونی فرستاده شود. برنامه ترجمه در سفر بدون اتصال کار میکند و دستیار تلفن میتواند پیامها را دستهبندی کند، بدون اینکه نسخهای از آنها در ابر ذخیره شود. تأخیر نیز کاهش مییابد، زیرا رفتوبرگشت شبکه حذف میشود. با این حال، خصوصی بودن فقط زمانی برقرار است که خود برنامه داده را مخفیانه ارسال نکند و بهروزرسانیها و گزارش خطا شفاف باشند.
روی تلفن، حافظه تنها محدودیت نیست. مصرف انرژی و گرما تعیین میکنند مدل برای چند دقیقه یا چند ساعت قابل استفاده باشد. یک فایل ۵.۹ گیگابایتی میتواند در حافظه دستگاه جا شود، اما اجرای پیوسته آن باتری را تحت فشار میگذارد. سازندگان تراشه در سالهای اخیر واحدهای عصبی ویژهای به گوشیها افزودهاند و مدلهای سهحالته شاید بهتر از معماریهای معمولی از این واحدها استفاده کنند. نتیجه واقعی به سازگاری نرمافزار، پهنای باند حافظه و بهینهسازی هر تراشه وابسته است.
PrismML توسط گروهی از پژوهشگران کلتک بنیان گذاشته شده و بابک حسیبی، استاد این دانشگاه و متخصص فشردهسازی، مدیریت آن را برعهده دارد. یون استویکا، همبنیانگذار Databricks و مدیر آزمایشگاه Sky Computing برکلی، مشاور شرکت است. استارتاپ در مرحله بذر ۲۲.۲۵ میلیون دلار جذب کرده و Khosla Ventures، Cerberus Capital و کلتک از حامیان آن هستند. حضور نامهای دانشگاهی معتبر انتظار برای انتشار جزئیات فنی قابل بازبینی را نیز بالا میبرد.
رقابتی که فقط بر سر کوچکتر شدن نیست
PrismML تنها شرکتی نیست که مدلها را کوچک میکند. شرکتهایی مانند Multiverse Computing و تیمهای داخلی سازندگان تراشه روی کوانتیزهسازی، هرس وزنها و تقطیر دانش کار میکنند. برخی مدل کوچک را از ابتدا آموزش میدهند و برخی هوش مدل بزرگتر را به نمونهای سبک منتقل میکنند. مزیت ادعایی Bonsai حفظ تقریباً کامل عملکرد پس از فشردهسازی شدید است. اگر رقبا به نتیجه مشابه برسند، استانداردهای باز و پشتیبانی از سختافزار اهمیت بیشتری از نام یک الگوریتم پیدا خواهد کرد.
نسخه نخست Bonsai بیش از ۱۱ میلیون بار دانلود شده و مدلهای کوچکتر شرکت نیز در مجموع ۲.۶ میلیون دانلود داشتهاند. دانلود زیاد به معنای استفاده فعال یا موفقیت تجاری نیست، اما علاقه توسعهدهندگان را نشان میدهد. شرکت اکنون باید ابزار نصب، مستندات، مجوز روشن و پشتیبانی از قالبهای رایج را فراهم کند. مدلی که از نظر پژوهشی درخشان است ولی راهاندازی دشواری دارد، بهسختی وارد برنامههای عمومی میشود.
هدف بعدی تیم، فشرده کردن مدلهایی با چند صد میلیارد پارامتر در ماههای آینده است. حسیبی معتقد است مدلهای بزرگتر فضای بیشتری برای حذف افزونگی دارند و شاید حفظ هوش آنها حتی آسانتر باشد. از نظر نظری، شبکه بزرگ مسیرهای تکراری بیشتری برای نمایش یک الگو دارد؛ اما هزینه تبدیل، آزمایش و توزیع آن نیز بالا میرود. همچنین یک مدل بسیار فشرده همچنان ممکن است برای تلفن بیش از حد بزرگ باشد و بیشتر به رایانههای شخصی یا سرورهای کوچک محلی بخورد.
حرکت هوش مصنوعی به لبه شبکه، ابر را حذف نمیکند. مدلهای عظیم برای آموزش، پرسشهای بسیار پیچیده و هماهنگی ابزارهای متعدد همچنان در مرکز داده میمانند. محتملتر آن است که سامانهها ترکیبی شوند: درخواست ساده روی دستگاه پاسخ بگیرد و مسئله دشوار، با اجازه کاربر، به ابر فرستاده شود. این تقسیم کار هزینه و مصرف پهنای باند را پایین میآورد و سرویس را در زمان قطع اینترنت زنده نگه میدارد.
Bonsai 2 نشان میدهد مسابقه هوش مصنوعی فقط برای ساخت مدل بزرگتر نیست؛ برای رساندن توان موجود به سختافزار کوچکتر هم هست. اگر عملکرد ۹۸ درصدی و مصرف قابل قبول در ارزیابی مستقل تکرار شود، تلفن و لپتاپ میتوانند از دروازه ورود به سرویس ابری، به میزبان واقعی مدل تبدیل شوند. آن تغییر شاید کمتر از رونمایی یک مدل غولپیکر هیجان رسانهای بسازد، اما اثرش بر هزینه، حریم خصوصی و دسترسی روزمره عمیقتر خواهد بود.
منبع: TechCrunch



