>> ماسک طرح ساخت قدرتمندترین خوشه آموزشی هوش مصنوعی جهان را با ۱۰۰ هزار پردازشگر انویدیا پیش میبرد > ایلان ماسک

>> ماسک طرح ساخت قدرتمندترین خوشه آموزشی هوش مصنوعی جهان را با ۱۰۰ هزار پردازشگر انویدیا پیش میبرد > ایلان ماسک

>> ماسک طرح ساخت قدرتمندترین خوشه آموزشی هوش مصنوعی جهان را با ۱۰۰ هزار پردازشگر انویدیا پیش میبرد > ایلان ماسک، مدیرعامل شرکت، برنامهای گسترده برای گسترش زیرساختهای سختافزاری آموزش هوش مصنوعی را اعلام کرد. بر اساس این طرح، شرکت قصد دارد در کوتاهترین زمان ممکن یک خوشه پردازشی متشکل از ۱۰۰ هزار واحد پردازش گرافیکی (GPU) از سری هاپر انویدیا را راهاندازی نماید.

این حرکت با هدف تقویت موقعیت رقابتی در برابر غولهای دیگر فعال در حوزه هوش مصنوعی صورت میگیرد. انفصال از اوراکل و استقلال در توسعه زیرساخت طبق اخبار منتشر شده توسط خبررسان، همکاری قراردادی میان و اوراکل به پایان رسیده است. پیش از این، اوراکل متعهد شده بود توسعه خوشه ۱۰۰ هزارتایی پردازشگر را بر عهده بگیرد، اما اکنون ماسک تأکید کرده که ساخت و مدیریت این زیرساخت مستقیماً توسط تیمهای داخلی انجام خواهد شد.

در حال حاضر، اوراکل تنها ۲۴ هزار پردازشگر هاپر را برای آموزش مدل گراک ۲ ( ۲) در اختیار این شرکت قرار داده است. افزایش سرعت آموزش و اهداف استراتژیک ماسک ادعا میکند که سیستم جدید قادر خواهد بود فرآیند آموزش مدلهای هوش مصنوعی را در سریعترین زمان ممکن به پایان برساند.

او این خوشه را قدرتمندترین سیستم آموزشی جهان با اختلاف زیاد توصیف کرده و اعلام کرد که عملیات آموزش بر روی این پلتفرم از ماه جاری میلادی آغاز میشود. این گام نشاندهنده تمرکز جدی بر مقیاسبندی سختافزاری برای دستیابی به برتری در کارایی مدلهاست.

آمادگی انتشار گراک ۲ و چشماندازهای آینده همزمان با توسعه زیرساخت، مدل گراک ۲ در مراحل نهایی اصلاح و رفع اشکال قرار دارد و طبق برنامهریزیهای اعلامشده، قرار است از ماه آینده میلادی به صورت عمومی منتشر شود. شرکت که تا پیش از این در رقابتهای هوش مصنوعی حضور کمرنگی داشته، با این سرمایهگذاریهای کلان سعی دارد جایگاه خود را در صف اول شرکتهای پیشرو تثبیت کند.

>> رقابت سختافزاری در عصر هوش مصنوعی جنگ قدرت در صنعت هوش مصنوعی از فاز الگوریتمی به فاز سختافزاری و انرژیای منتقل شده است. شرکتهای پیشرو مانند اوپنایآی (OpenAI)، گوگل دیپمَایند (Google )، متا و مایکروسافت (Microsoft) سالها است که در حال انباشت دهها هزار پردازشگر گرافیکی برای آموزش مدلهای پیشرو هستند.

در این میان، تصمیم برای ساخت یک خوشه ۱۰۰ هزارتایی بهصورت مستقل و بدون وابستگی به ارائهدهندگان ابری شخص ثالث، نشاندهنده یک تغییر استراتژیک بنیادین است کنترل کامل بر زنجیره تأمین محاسبه، بهینهسازی هزینه درازمدت و انعطافپذیری در زمانبندی آموزش مدلها. چرا ۱۰۰ هزار پردازشگر هاپر (/)؟

معماری هاپر انویدیا، با پشتیبانی از محاسبه، حافظه پهنای باند بالا و تکنولوژی ترانسفورمر انجین، فعلاً کارکنان اصلی آموزش مدلهای بزرگ زبان (LLM) و چندمدال هستند. یک خوشه ۱۰۰ هزارتایی از این پردازشگرها، با در نظر گرفتن کارایی واقعی شبکه و سربار توزیع، میتواند توان محاسبهای معادل چندین اکزا فلاپس در دقت مختلط ارائه دهد. این ظرفیت به معنای امکان آموزش مدلهایی با ترلیونها پارامتر در روزهای معدود است، نه هفتهها یا ماهها.

چالشهای مهندسی انرژی، خنکسازی و اتصالبندی راهاندازی چنین مقیاسی تنها خرید سختافزار نیست. نیازهای برق برای ۱۰۰ هزار پردازشگر هاپر (هر کدام با TDP حدود ۷۰۰ وات، به علاوه سربار سرور، سوئیچ و خنکسازی) به راحتی از ۱۰۰ مگاوات فراتر میرود. این معادل مصرف برق یک شهر کوچک است. از سوی دیگر، خنکسازی مایع بهصورت اجباری جایگزین خنکسازی هوایی میشود.

در لایه اتصال، استفاده از تکنولوژی انویدیا انویلینک و انویلینک سوئیچ بههمراه اینفینیبند یا اترنت روکاو برای مقیاس ۱۰۰ هزار گره، یک معجزه مهندسی شبکه محسوب میشود تا ناخالصیهای ارتباطی کارایی مقیاسبندی را زیر ۶۰٪ نیندازد.

جدیدترین اخبار و مهم ترین رویدادهای ۲۴ ساعته در بخش های حوادث ، اجتماعی ، سیاسی ، اقتصاد و تکنولوژی ، ورزشی ، فرهنگ وهنر ایران و سایر مناطق جهان را در مهتاب من بخوانید.

استراتژی داده و آموزش از گراک ۲ به سمت گراک ۳ و فراتر گراک ۲ که انتشار آن از ماه آینده میلادی انتظار میرود، احتمالاً بر روی زیرساختهای موجود (شامل ۲۴ هزار پردازشگر اوراکل و بخشهایی از خوشه جدید) آموزش دیده است. اما هدف نهایی، استفاده از کل ظرفیت ۱۰۰ هزارتایی برای آموزش نسلهای بعدی — گراک ۳ و گراک ۴ — است. ماسک بارها اشاره کرده که مقیاس تنها متغیر حیاتی برای رسیدن به هوش مصنوعی عمومی (AGI) است.

با این خوشه، میتواند چرخه تکرار را از ماهها به هفتهها کاهش دهد دادههای بیشتر، مدل بزرگتر، محاسبه بیشتر، ارزیابی سریعتر، اصلاح سریعتر. منابع داده منحصر به فرد مزیت رقابتی ایکس برخلاف رقبا که بیشتر به دادههای عمومی وب، ویکیپدیا، کتابها و کدهای اوپنسورس وابستهاند، دسترسی انحصاری به جریان دادههای بلادرنگ پلتفرم ایکس — شامل מילیاردها پست، گفتگو، خبر، نظر و محتوای چندرسانهای روزانه — یک دارایی استراتژیک منحصر به فرد است.

این دادهها هم تازه هستند، هم تنوع زبانی و فرهنگی بالا دارند و هم پویای رویدادهای جهان را منعکس میکنند. ادغام این جریان در پیشآموزش و تنظیم دقیق میتواند به مدلهای گراک درکِ حال و اکنون بدهد که مدلهای دیگر فاقد آناند. اقتصاد واحد محاسبه هزینه سرمایهگذاری در برابر اجاره ابری خرید ۱۰۰ هزار پردازشگر هاپر با قیمت تقریبی ۳۰ تا ۴۰ هزار دلار واحد، سرمایهگذاری خالص سختافزاری ۳ تا ۴ میلیارد دلاری است.

با احتساب زیرساختهای دیتاسنتر، برق، شبکه، پرسنل و عملیات، رقم کل به ۵ تا ۶ میلیارد دلار میرسد. در مقایسه، اجاره همین ظرفیت از ارائهدهندگان ابری مانند اوراکل، AWS، یا گوگل کلود، سالانه ۱.۵ تا ۲ میلیارد دلار هزینه دارد. در بازه ۳ تا ۴ ساله، مالکیت صرفه اقتصادی دارد، اما ریسک تقادم سختافزار — با ظهور معماری بلکول و روبین انویدیا — واقعی است.

استراتژی ماسک به نظر میرسد روی مالکیت و کنترل بهجای انعطاف اجاره تکیه دارد. تأثیر بر اکوسیستم انویدیا و زنجیره تأمین جهانی سفارش ۱۰۰ هزار واحد هاپر (و احتمالاً سفارشهای پیشفروش بلکول /) فشار مضاعفی بر زنجیره تأمین TSMC (تولید تراشه)، SK / / (حافظه HBM) و انویدیا (بستهبندی و تست) میآورد. این تقاضا میتواند زمان تحویل برای سایر مشتریان را افزایش دهد و قیمتهای بازار ثانویه را بالا ببرد.

از سوی دیگر، انویدیا با دیدن یک مشتری استراتژیک که مستقیماً خرید میکند و نه از واسطههای ابری، انگیزه بیشتری برای اولویتبندی تخصیص تخصیص و پشتیبانی مهندسی مستقیم دارد.

منظور از قدرتمندترین خوشه آموزشی جهان با اختلاف زیاد این ادعا بر اساس معیارهای زیر قابل دفاع است (۱) تعداد گرههای پردازشگر یکپارچه در یک خوشه واحد — اکثر رقبا خوشههایشان را به چند دیتاسنتر جغرافیایی توزیع کردهاند که تأخیر شبکه را بالا میبرد؛ (۲) همگنسازی سختافزاری — همه گرهها یک معماری (هاپر) و یک پشته نرمافزاری دارند، برخلاف محیطهای ابری ترکیبی؛ (۳) بهینهسازی پشته نرمافزاری سفارشی — تیم میتواند درایورها، کتابخانههای ارتباطی (NCCL، RCCL)، زمانبندی کارها و فریمورک آموزش (، JAX، ) را بهصورت اختصاصی برای این توپولوژی بهینه کند؛ (۴) کنترل کامل بر زمانبندی و اولویتبندی کارها — بدون صفهای اشتراکی ابری.

ریسکها و چالشهای پیش رو مقیاسبندی نرمافزاری آموزش موثر بر روی ۱۰۰ هزار GPU نیازمند بهینهسازیهای پیشرفته موازیسازی تنسور، خطی، داده و موازیسازی تخصصی ( برای ) است. هر ناکارآمدی ۱٪ در مقیاس ۱۰۰ هزار، معادل هزاران GPU بیکار است. موثریت داده قانون مقیاسبندی نشان میدهد که افزایش محاسبه بدون افزایش متناسب دادههای باکیفیت، بازدهی حاشیهای را کاهش میدهد.

نیاز به دادههای چندترابایتی باکیفیت، فیلترشده و متنوع، چالش جداگانهای است. پایداری سختافزاری نرخ خرابی سختافزاری در مقیاس ۱۰۰ هزار، روزانه دهها گره خراب یعنی. سیستمهای خودکار عیبیابی، جداسازی و جایگزینی حیاتی هستند. تنظیمات و ایمنی ( & ) مدلهای بسیار بزرگتر، ریسکهای جدیدی در زمینه توهم، سوگیری، سوءاستفاده و کنترلپذیری ایجاد میکنند که نیاز به سرمایهگذاری موازی در تحقیق ایمنی دارند.

رقابت تنظیمی تمرکز قدرت محاسبه در دست یک موجودیت، دغدغههای ضدتوافق و امنیت ملی را در سطح جهانی برانگیخته است. چشمانداز ۱۲ تا ۱۸ ماهه از گراک ۲ تا گراک ۳ و فراتر با توجه به زمانبندی اعلامشده ماه جاری آغاز آموزش روی خوشه جدید (احتمالاً با تعداد کمتر از ۱۰۰ هزار، در حال رشد). ماه آینده انتشار گراک ۲ (مدل متوسط/بزرگ، بهینهشده برای استدلال و کدنویسی).

نیمه دوم سال تکمیل خوشه ۱۰۰ هزارتایی، آغاز آموزش گراک ۳ (مدل بسیار بزرگ، احتمالاً با ترلیونها پارامتر فعال). اول سال بعد انتشار گراک ۳، همزمان با ظهور معماری بلکول انویدیا — که ممکن است باعث شود بخشی از خوشه ارتقا یابد یا خوشه دوم بلکول راهاندازی شود.

نتیجهگیری یک نقطه عطف در تعادل قدرت هوش مصنوعی حرکت برای ساخت بزرگترین خوشه آموزشی اختصاصی جهان، نه تنها یک حرکت تبلیغاتی، بلکه یک ضرورت استراتژیک برای بقا در جنگ هوش مصنوعی است. اگر با موفقیت اجرا شود، این خوشه به یک موتور محاسبه تبدیل میشود که به تکرار سریع، مقیاس بزرگ و نوآوری مداوم در مدلهای گراک میانجامد.

نتیجه نهایی بستگی دارد به (۱) اجرای بینقص مهندسی سختافزاری و نرمافزاری، (۲) تأمین دادههای باکیفیت در مقیاس، (۳) مدیریت هزینه و انرژی بهصورت پایدار، و (۴) تبدیل قدرت محاسبه به پیشرفتهای واقعی در استدلال، کدنویسی، درک چندمدال و ایمنی مدل. جهان تکنولوژی بهدقت نظارهگر این آزمایش بزرگ است — موفقیت یا شکست آن، مسیر صنعت را برای سالهای آینده شکل خواهد داد.