هوش مصنوعی
موضوعات داغ

بایت‌دنس در تدارک مدل ۱۰ تریلیون پارامتری؛ زنگ خطر برای هوش مصنوعی Mythos

رقابت بر سر مقیاس: آیا مدل ۱۰ تریلیون پارامتری بایت‌دنس می‌تواند هژمونی Anthropic را بشکند؟

مدل ۱۰ تریلیون پارامتری بایت دنس چیست؟ رقابت چین با مدل Mythos شرکت Anthropic

پروژه عظیم و محرمانه مالک تیک‌تاک برای عبور از مرز ۱۰ تریلیون پارامتر زیر سایه سنگین تحریم‌های تراشه‌ای آمریکا

شرکت چینی ByteDance در حال آموزش یک مدل هوش مصنوعی با حداکثر ۱۰ تریلیون پارامتر است؛ پروژه‌ای که در صورت تحقق، آن را به بزرگ‌ترین مدل هوش مصنوعی چین از نظر مقیاس تبدیل می‌کند و از نظر اندازه، به مدل پیشرفته Mythos شرکت Anthropic نزدیک خواهد کرد. این خبر نخستین‌بار بر اساس گزارش Financial Times منتشر شده و هنوز مشخصات نهایی مدل یا حتی نام آن اعلام نشده است.

براساس اطلاعات منابع آگاه که Financial Times به آن‌ها استناد کرده، مدل جدید بایت‌دنس اکنون در مرحله پیش‌آموزش (Pre-training) قرار دارد؛ مرحله‌ای که بسته به مقیاس پروژه می‌تواند چندین ماه زمان ببرد. برآورد فعلی این است که پیش‌آموزش مدل حدود سه تا شش ماه طول بکشد و پس از آن، فرآیندهایی مانند تنظیم دقیق برای آماده‌سازی مدل جهت استفاده عملی دنبال شود. بایت‌دنس تاکنون این گزارش را به‌صورت رسمی تأیید نکرده است و رویترز نیز اعلام کرده که نتوانسته به‌طور مستقل جزئیات پروژه را تأیید کند.

اگر عدد ۱۰ تریلیون پارامتر در نهایت به اندازه واقعی مدل اشاره داشته باشد، مقیاس پروژه بایت‌دنس بسیار قابل‌توجه خواهد بود. برای مقایسه، مدل Kimi K3 شرکت چینی Moonshot AI که در حال حاضر در میان بزرگ‌ترین مدل‌های چینی قرار دارد، حدود ۲٫۸ تریلیون پارامتر دارد. بنابراین مدل مورد انتظار بایت‌دنس می‌تواند بیش از سه برابر Kimi K3 پارامتر داشته باشد. مدل‌هایی مانند LongCat-2.0 از Meituan و V4-Pro از DeepSeek نیز در گزارش‌های موجود در محدوده حدود ۱٫۶ تریلیون پارامتر قرار دارند.

سایبرکست قسمت 118 : بایت‌دنس در تدارک مدل ۱۰ تریلیون پارامتری

مدل هوش مصنوعی ۱۰ تریلیون‌پارامتری بایت‌دنس برای رقابت با مدل Mythos آنتروپیک

بایت‌دنس در حال آموزش مدل هوش مصنوعی ۱۰ تریلیون‌پارامتری برای رقابت با Anthropic است

از Kimi K3 تا هوش مصنوعی جدید بایت‌دنس؛ رقابت در چین به توسعه مدل‌های بنیادین غول‌پیکر کشیده شد

با این حال، تعداد پارامتر به‌تنهایی معیار مناسبی برای سنجش هوش یک مدل نیست. پارامترها را می‌توان به‌عنوان وزن‌ها و تنظیماتی در نظر گرفت که شبکه عصبی طی فرآیند آموزش از داده‌ها یاد می‌گیرد. افزایش تعداد آن‌ها معمولاً نشان‌دهنده افزایش مقیاس مدل و ظرفیت بالقوه آن برای یادگیری الگوهای پیچیده‌تر است، اما معماری مدل، داده‌های آموزشی، روش آموزش، میزان محاسبات و شیوه استفاده از مدل نیز در عملکرد نهایی نقش تعیین‌کننده دارند. به همین دلیل، یک مدل کوچک‌تر و بهینه‌تر می‌تواند در برخی وظایف از مدلی بسیار بزرگ‌تر عملکرد بهتری داشته باشد.

رقابت بایت‌دنس با Mythos؛ نبردی که فعلاً نمی‌توان آن را با عدد پارامتر سنجید

اهمیت خبر زمانی بیشتر می‌شود که مدل جدید بایت‌دنس را در کنار Mythos، یکی از پیشرفته‌ترین سیستم‌های Anthropic، قرار دهیم. براساس برآوردهای صنعتی نقل‌شده در گزارش Financial Times، Mythos حدود ۸ تریلیون پارامتر دارد و مدل جدید بایت‌دنس در صورت رسیدن به سقف ۱۰ تریلیون پارامتر، از نظر مقیاس حتی می‌تواند بزرگ‌تر باشد.

اما یک نکته مهم وجود دارد: Anthropic تعداد واقعی پارامترهای مدل‌های پیشرفته خود را به‌صورت رسمی منتشر نمی‌کند. بنابراین اعداد مربوط به Mythos، مانند برآوردهای مربوط به مدل جدید بایت‌دنس، قطعی و قابل مقایسه با مشخصات رسمی یکدیگر نیستند. همین مسئله باعث می‌شود فعلاً نتوان گفت مدل چینی از نظر توانایی هوش مصنوعی واقعاً به Mythos رسیده یا حتی به آن نزدیک شده است.

در واقع، آنچه این خبر را مهم می‌کند نه اثبات برتری بایت‌دنس، بلکه تغییر مقیاس رقابت مدل‌های پیشرفته در چین است. شرکت‌های چینی در ماه‌های اخیر به‌سرعت به سمت مدل‌هایی با بیش از یک تریلیون پارامتر حرکت کرده‌اند و این روند نشان می‌دهد رقابت دیگر صرفاً بر سر عرضه سریع‌تر مدل‌های کوچک و ارزان نیست؛ بلکه توسعه مدل‌های بنیادین بسیار بزرگ نیز به یکی از محورهای اصلی رقابت تبدیل شده است.

برای بایت‌دنس نیز این حرکت بخشی از سرمایه‌گذاری گسترده‌تر شرکت روی هوش مصنوعی است. این شرکت در کنار مدل‌های زبانی و محصولات مصرفی، روی خانواده مدل‌های Seed و فناوری‌های تولید ویدئو نیز فعالیت می‌کند و واحد ابری Volcano Engine را برای کاربردهای سازمانی و زیرساخت هوش مصنوعی توسعه داده است. گزارش Financial Times همچنین به گسترش تیم هوش مصنوعی Seed و سرمایه‌گذاری بایت‌دنس روی زیرساخت مراکز داده اشاره می‌کند.

مسئله فقط ساخت مدل بزرگ‌تر نیست

رسیدن به مقیاس ۱۰ تریلیون پارامتر یک چالش صرفاً نرم‌افزاری نیست. آموزش چنین مدلی به حجم عظیمی از محاسبات، حافظه، ارتباطات بین پردازنده‌ها، انرژی و زیرساخت شبکه نیاز دارد. هرچه تعداد پارامترها افزایش پیدا می‌کند، مدیریت حافظه و هماهنگ‌سازی پردازش میان تعداد زیادی شتاب‌دهنده نیز پیچیده‌تر می‌شود.

این موضوع برای یک شرکت چینی اهمیت بیشتری دارد؛ زیرا محدودیت‌های صادراتی آمریکا دسترسی شرکت‌های چینی به پیشرفته‌ترین تراشه‌های هوش مصنوعی را دشوار کرده است. بایت‌دنس در همین شرایط، سرمایه‌گذاری خود را روی زیرساخت محاسباتی افزایش داده و طبق گزارش‌های قبلی، حتی روی تراشه‌های اختصاصی برای آموزش و استنتاج مدل‌های هوش مصنوعی نیز کار می‌کند. The Information گزارش داده بود که یکی از پروژه‌های تراشه‌ای بایت‌دنس برای آموزش مدل‌ها طراحی شده؛ کاری که از نظر فنی و هزینه‌ای دشوارتر از توسعه تراشه‌های مخصوص استنتاج محسوب می‌شود.

بنابراین، اگر گزارش مربوط به مدل ۱۰ تریلیون‌پارامتری درست باشد، اهمیت آن تنها به بزرگی مدل محدود نمی‌شود. بایت‌دنس عملاً در حال آزمودن این مسئله است که آیا می‌توان در شرایط محدودیت دسترسی به سخت‌افزارهای پیشرفته، زیرساخت لازم برای آموزش یک مدل در مقیاس فراتر از چند تریلیون پارامتر را ایجاد کرد یا خیر.

در عین حال، نباید فراموش کرد که پروژه هنوز در مراحل ابتدایی قرار دارد. مدل در حال پیش‌آموزش است و مشخص نیست در نهایت با چه تعداد پارامتر تکمیل خواهد شد، چه معماری‌ای خواهد داشت، چه مقدار از پارامترها در هر مرحله فعال می‌شوند و مهم‌تر از همه، در آزمون‌های واقعی چه سطحی از عملکرد را ارائه خواهد کرد. عدد ۱۰ تریلیون در شرایط فعلی بیشتر نشان‌دهنده مقیاس هدف پروژه است تا یک مشخصه نهایی و تأییدشده.

اگر این پروژه طبق برنامه پیش برود، بایت‌دنس می‌تواند یکی از بزرگ‌ترین جهش‌های مقیاس در صنعت هوش مصنوعی چین را رقم بزند؛ اما قضاوت درباره موفقیت آن باید تا زمان انتشار اطلاعات فنی، نتایج ارزیابی و عملکرد واقعی مدل به تعویق بیفتد. در حال حاضر، چیزی که با اطمینان بیشتری می‌توان گفت این است که رقابت هوش مصنوعی چین و آمریکا بار دیگر وارد مرحله‌ای شده که مقیاس مدل، زیرساخت محاسباتی و توانایی آموزش مدل‌های چندتریلیون‌پارامتری به میدان اصلی رقابت تبدیل شده‌اند.

مراحل پیش‌آموزش و بهینه‌سازی مدل‌های لایه‌ای چندتریلیون‌پارامتری در مراکز داده

جمع‌بندی : 

تلاش بایت‌دنس برای آموزش یک مدل ۱۰ تریلیون پارامتری، نقطه عطفی در رقابت‌های هوش مصنوعی میان شرق و غرب است. این پروژه نشان می‌دهد که غول‌های فناوری چین دیگر به دنبال تقطیر و کپی‌برداری نیستند، بلکه قصد دارند با غلبه بر چالش‌های سخت‌افزاری و تحریم‌ها، زیرساخت‌های بنیادین خود را برای شکست دادن سیستم‌های پیشرفته‌ای چون Mythos توسعه دهند. در نهایت، برنده این نبرد کسی خواهد بود که بتواند بین مقیاس عظیم و کارایی مدل، بهترین تعادل را ایجاد کند.

توسعه تراشه‌های اختصاصی آموزش هوش مصنوعی توسط بایت‌دنس در شرایط تحریم سخت‌افزاری

———————————————————————————

نکات کلیدی:

  • جهش بی‌سابقه در مقیاس: بایت‌دنس در حال پیش‌آموزش (Pre-training) یک مدل هوش مصنوعی با حداکثر ۱۰ تریلیون پارامتر است که آن را به بزرگ‌ترین مدل در چین تبدیل می‌کند.

  • رقابت مستقیم با آمریکا: هدف اصلی این پروژه، رقابت با مدل پیشرفته Mythos (به‌ویژه Mythos 5) از شرکت Anthropic است که تخمین زده می‌شود حدود ۸ تریلیون پارامتر داشته باشد.

  • فاصله معنادار با رقبای داخلی: این مدل در صورت موفقیت، بیش از ۳ برابر بزرگ‌تر از مدل Kimi K3 شرکت Moonshot AI (با ۲.۸ تریلیون پارامتر) خواهد بود که در حال حاضر یکی از بزرگ‌ترین مدل‌های چین است.

  • زمان‌بندی توسعه: مرحله پیش‌آموزش این مدل بین ۳ تا ۶ ماه زمان می‌برد و پس از آن مراحل تنظیم دقیق (Fine-tuning) انجام خواهد شد.

  • چالش‌های زیرساختی: آموزش چنین مدلی نیازمند قدرت پردازشی و پهنای باند عظیمی است؛ چالشی که با توجه به محدودیت‌های صادراتی تراشه‌های آمریکایی به چین، بایت‌دنس را مجبور به توسعه تراشه‌های اختصاصی کرده است.

  • اهمیت کیفیت بر کمیت: تعداد پارامتر به‌تنهایی تضمین‌کننده موفقیت نیست و عواملی چون کیفیت داده‌ها، معماری مدل و بهینه‌سازی محاسباتی نقش کلیدی در عملکرد نهایی دارند.

نکات تکمیلی:

  • تأکید بر استقلال فناوری: ژانگ ییمینگ (Zhang Yiming)، بنیان‌گذار بایت‌دنس، شخصاً به تیم توسعه دستور داده است که از کپی‌برداری و تقطیر (Distillation) مدل‌های غربی خودداری کنند و تمرکز خود را روی ساخت توانمندی‌های بنیادین و مستقل بگذارند.

  • پایگاه کاربری آماده: بایت‌دنس برخلاف بسیاری از استارتاپ‌ها، بستر انتشار فوق‌العاده‌ای دارد. دستیار هوش مصنوعی فعلی این شرکت به نام Doubao با ۳۲۴ میلیون کاربر فعال ماهانه، تشنه دریافت قدرت پردازشی این مدل جدید است.

  • مدل‌های متن‌بسته (Closed-source): برخلاف بسیاری از شرکت‌های چینی که به مدل‌های متن‌باز گرایش دارند، انتظار می‌رود بایت‌دنس این مدل قدرتمند را در انحصار اکوسیستم خود (مثل تیک‌تاک و سرویس ابری Volcano Engine) نگه دارد.

نتیجه گیری:

خیز بایت‌دنس برای آموزش یک مدل ۱۰ تریلیون پارامتری نشان می‌دهد که صنعت هوش مصنوعی چین از فاز «کپی‌برداری و مدل‌های اقتصادی» عبور کرده و وارد رقابت در لبه تکنولوژی جهانی شده است. این پروژه عظیم، علاوه بر رقابت نرم‌افزاری با سیستم‌هایی نظیر Mythos، یک آزمون بزرگ برای تاب‌آوری زیرساخت‌های سخت‌افزاری چین در برابر تحریم‌های آمریکا محسوب می‌شود.

پرسش‌های تحقیقاتی بیشتر:

  • با توجه به تحریم‌های صادراتی تراشه‌هایی مانند H100 انویدیا، بایت‌دنس دقیقاً از چه ترکیبی از سخت‌افزارهای داخلی و خارجی برای تأمین توان پردازشی توزیع‌شده برای ۱۰ تریلیون پارامتر استفاده می‌کند؟

  • افزایش تصاعدی تعداد پارامترها تا چه حد باعث افزایش ردپای کربنی (Carbon Footprint) و مصرف انرژی دیتاسنترها می‌شود و آیا این روند در بلندمدت پایدار است؟

  • اگر بایت‌دنس بتواند از طریق معماری اختصاصی، عملکردی بهتر از Mythos 5 ارائه دهد، رویکرد رگولاتورهای غربی در قبال دسترسی جهانی به محصولات این شرکت (مانند تیک‌تاک) چگونه تغییر خواهد کرد؟

  • آیا پافشاری بر افزایش پارامترها باعث غفلت از معماری‌های جایگزین و کارآمدتر (مانند Small Language Models یا مدل‌های تخصصی کوچک) در استراتژی غول‌های فناوری نخواهد شد؟

زیرساخت ابری Volcano Engine بایت‌دنس برای پردازش و آموزش مدل‌های بزرگ هوش مصنوعی

سخن پایانی نویسنده :

وقتی داشتم این خبر را برای سایبرمگ می‌نوشتم، مدام به این فکر می‌کردم که سرعت پیشرفت در دنیای AI چقدر وحشتناک شده است! تا همین دو سال پیش، مدل‌هایی با چند میلیارد پارامتر مرز تکنولوژی محسوب می‌شدند، اما حالا بایت‌دنس و انتروپیک خیلی راحت درباره اعداد «تریلیونی» صحبت می‌کنند. راستش را بخواهید، مقایسه این نبرد خدایان تکنولوژی با وضعیت خودمان در ایران کمی دردناک است. در حالی که شرکت‌های چینی با وجود تحریم‌های سنگین آمریکا، در حال دور زدن محدودیت‌ها و ساخت دیتاسنترهای غول‌پیکر برای آموزش مدل‌های ۱۰ تریلیون پارامتری هستند، ما اینجا درگیر ابتدایی‌ترین زیرساخت‌های اینترنت، فیلترینگ و هزینه‌های سرسام‌آور دسترسی به یک سرور ابری ساده یا APIهای پایه هستیم. با این حال، دنبال کردن این اخبار برای ما حیاتی است؛ چرا که امواج این سونامی فناوری، دیر یا زود به ساحل ما هم می‌رسد و توسعه‌دهندگان ایرانی باید بدانند معماری پلتفرم‌های آینده بر پایه چه غول‌های پردازشی بنا شده است.

منبع : به گزارش Financial Times
منبع : به گزارش Reuters
منبع : به گزارش The Information

 

هوش مصنوعی | واقعیت مجازی | تکنولوژی در مجله خبری سایبرلایف

در مجله سایبرلایف بخوانید

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

دکمه بازگشت به بالا