نشریه رخشای

رویدادهای هوش مصنوعی ایرانی

«Haman Persian Article Graph-LLM 125M »؛ نخستین LLM ایرانی ساخته‌شده با معماری ایرانی به صورت منبع باز

11 دقیقه مطالعه

گامی برای قدرتمندتر کردن زبان فارسی در عصر هوش مصنوعی

ما در شرکت دانش‌بنیان آریا هامان مهر پارسه، با افتخار مدل Haman Persian Article Graph-LLM 125M را به‌عنوان نخستین LLM ایرانی ساخته‌شده با معماری ایرانی معرفی می‌کنیم.

هامان ۱۲۵M نخستین عضو از خانواده مدل‌های زبانی هامان است ؛ خانواده‌ای که با هدف توسعه زیرساخت‌های بومی هوش مصنوعی، افزایش توان پردازش زبان فارسی و ایجاد تمرکز فناورانه در حوزه مدل‌های زبانی طراحی شده است. این مدل، نقطه آغاز مسیری است که در ادامه آن، متناسب با فراهم‌شدن زیرساخت‌های محاسباتی مورد نیاز، مدل‌های بزرگ‌تر، پیشرفته‌تر و قدرتمندتری نیز معرفی خواهند شد که بر مبنای معماری ایرانی با تمرکز بر زبان فارسی است .

آنچه Haman Persian Article را از بسیاری از مدل‌های فارسی موجود متمایز می‌کند، تنها استفاده از داده‌های فارسی نیست. معماری اصلی مدل، زیرساخت پردازش زبان، فرایند آماده‌سازی داده، توکن‌سازی، ساخت گراف زبانی و آموزش مدل، همگی در داخل ایران طراحی و پیاده‌سازی شده‌اند و معماری تولید ایرانی که توانسته گواهی دانش بنیان این معماری را دریافت کند .

به همین دلیل، هامان ۱۲۵M را صرفاً یک مدل فارسی‌سازی‌شده یا نسخه‌ای تنظیم‌شده از یک مدل خارجی نمی‌دانیم؛ بلکه آن را نخستین LLM ایرانی مبتنی بر یک معماری بومی و ایرانی معرفی می‌کنیم.

مدل Haman Persian Article بر پایه معماری و زیرساخت ایرانی Rakhshai Graph-based NLP (RGN) توسعه یافته است.

زبان فارسی به معماری بومی و ایرانی نیاز دارد

ما معتقدیم برای قدرتمندتر کردن زبان فارسی در عصر هوش مصنوعی، صرفاً جمع‌آوری داده‌های فارسی یا آموزش تکمیلی مدل‌های خارجی کافی نیست. زبان فارسی برای حضور جدی، مستقل و پایدار در آینده هوش مصنوعی، به معماری‌های بومی نیاز دارد.

در زمانی که تمام مدل های هوش مصنوعی در حال بهبود الگوریتم ها برای زبان های محلی کشور خود هستند ما اعتقاد داریم باید برای زبان فارسی نیز چهارچوبی متمرکز برای زبان فارسی وجود داشته باشد که بتواند تمرکز زیرساختی روی آن وجود داشته باشد .

به دلیل نبود این زیرساخت ما تمام مسیر از متن خام تا تولید و استفاده مدل llm و کلان داده را به صورت منبع باز و قابل توسعه در اختیار توسعه دهندگان و محققان قرار می دهیم .

هر زبان دارای ویژگی‌های خاص خود است. ساختار جمله، روابط معنایی، شیوه نگارش، فاصله و نیم‌فاصله، صرف واژه‌ها، ریشه‌های زبانی و ارتباط میان مفاهیم در زبان فارسی، با بسیاری از زبان‌های دیگر تفاوت دارد. هنگامی که یک مدل عمومی خارجی برای ده‌ها یا صدها زبان طراحی می‌شود، زبان فارسی معمولاً تنها یکی از زبان‌های جانبی آن مدل است و الزاماً در مرکز تصمیم‌های معماری قرار ندارد.

در مقابل، هنگامی که معماری از ابتدا با تمرکز بر زبان فارسی طراحی شود، می‌توان ویژگی‌های این زبان را در سطحی عمیق‌تر وارد فرایند مدل‌سازی کرد.

هدف ما از توسعه خانواده مدل‌های هامان، تنها تولید متن فارسی نیست. ما در تلاش هستیم زیرساختی ایجاد کنیم که زبان فارسی در آن یک قابلیت فرعی نباشد، بلکه هسته اصلی معماری، داده، آموزش و توسعه مدل را تشکیل دهد.

از نگاه ما، آینده قدرتمند زبان فارسی در هوش مصنوعی، از مسیر سه مؤلفه عبور می‌کند:

داده فارسی، معماری ایرانی و زیرساخت محاسباتی مناسب.

Haman Persian Article Graph-LLM 125M نخستین گام عملی ما در این مسیر است.

نخستین LLM ایرانی با معماری طراحی‌شده در ایران

Haman Persian Article Graph-LLM 125M از ابتدا در یک زنجیره توسعه بومی و ایرانی شکل گرفته است. ما در این پروژه تلاش کرده‌ایم اجزای اصلی مورد نیاز برای ساخت یک مدل زبانی فارسی را در قالب یک زیرساخت یکپارچه Rakhshai Graph-based NLP (RGN) توسعه دهیم.

این زنجیره شامل نرمال‌سازی و آماده‌سازی متون فارسی، ساخت توکن‌ساز، ایجاد گراف واژگانی، طراحی معماری مدل، آموزش، ارزیابی، ذخیره نقاط بازرسی و اجرای مدل است.

مدل Haman Persian Article با وزن‌های تصادفی آموزش خود را آغاز کرده است. در فرایند ساخت آن از یک مدل زبانی پایه خارجی ازپیش‌آموزش‌دیده، وزن‌های آماده، تعبیه‌های ازپیش‌آموزش‌دیده، تقطیر دانش یا داده‌های مصنوعی تولیدشده توسط مدل‌های زبانی خارجی استفاده نشده است.

این موضوع برای ما اهمیت ویژه‌ای دارد؛ زیرا هدف اصلی پروژه فقط ارائه یک فایل مدل نبوده است. هدف ما ایجاد دانش، توانایی و زیرساخت لازم برای تولید مدل‌های زبانی فارسی در داخل کشور است.

در واقع، Haman Persian Article نتیجه یک فرایند کامل بومی و ایرانی است؛ فرایندی که از طراحی معماری و آماده‌سازی داده آغاز شده و تا آموزش و انتشار مدل ادامه پیدا کرده است.

معماری ایرانی «Rakhshai Graph-based NLP (RGN)»؛ زیرساخت اصلی توسعه هامان

مدل هامان بر پایه معماری و زیرساخت ایرانی (RGN) Rakhshai Graph-based NLP توسعه یافته است.

RGN یک زیرساخت گراف‌محور برای پردازش زبان طبیعی فارسی است که با هدف ترکیب مدل‌های زبانی مدرن و شبکه‌های عصبی گرافی طراحی شده است. این زیرساخت مجموعه‌ای از ابزارهای مورد نیاز برای آماده‌سازی متن، ساخت گراف، آموزش مدل، ارزیابی، تولید متن و توسعه کاربردهای پردازش زبان طبیعی را در اختیار ما قرار می‌دهد.

یکی از تفاوت‌های مهم معماری RGN با مدل‌های زبانی متداول، استفاده از ساختار گرافی در کنار ساختار دنباله‌ای متن است.

مدل‌های زبانی رایج، متن را عمدتاً به‌صورت یک دنباله از توکن‌ها پردازش می‌کنند. در چنین رویکردی، هر توکن با توجه به توکن‌های قبل یا اطراف خود تحلیل می‌شود. این روش بسیار قدرتمند است، اما همه روابط موجود در زبان الزاماً به ترتیب ظاهری واژه‌ها محدود نمی‌شوند.

در زبان، میان واژه‌ها روابط مختلفی وجود دارد. برخی واژه‌ها به‌طور مکرر در کنار یکدیگر ظاهر می‌شوند، برخی دارای ریشه مشترک هستند و برخی از نظر معنایی یا ساختاری با یکدیگر ارتباط دارند.

در معماری RGN، این روابط در قالب یک گراف زبانی نیز مدل‌سازی می‌شوند. سپس اطلاعات استخراج‌شده از گراف با اطلاعات به‌دست‌آمده از Transformer ترکیب می‌شود.

این رویکرد به مدل اجازه می‌دهد علاوه بر ترتیب توکن‌ها، ارتباط میان واژه‌ها را نیز در فرایند یادگیری در نظر بگیرد.

ترکیب Transformer و شبکه عصبی گرافی

معماری RGN از ترکیب یک مدل زبانی مبتنی بر Transformer و یک شبکه عصبی گرافی استفاده می‌کند.

در این معماری، Transformer وظیفه پردازش دنباله متن و استخراج اطلاعات زمینه‌ای را بر عهده دارد. در کنار آن، شبکه عصبی گرافی اطلاعات مربوط به روابط میان واژه‌ها را از گراف زبانی دریافت و پردازش می‌کند.

در مرحله بعد، بازنمایی دنباله‌ای متن و بازنمایی گرافی واژه‌ها با یکدیگر ترکیب می‌شوند.

این ترکیب به‌صورت ثابت انجام نمی‌شود. معماری از یک سازوکار دروازه‌ای مبتنی بر زمینه استفاده می‌کند تا مدل بتواند یاد بگیرد در هر موقعیت، چه میزان از اطلاعات Transformer و چه میزان از اطلاعات گراف استفاده کند.

به بیان ساده‌تر، مدل می‌تواند بر اساس متن و موقعیت هر واژه تصمیم بگیرد که در آن لحظه، ترتیب توکن‌ها اهمیت بیشتری دارد یا روابط گرافی میان واژه‌ها.

این ویژگی یکی از پایه‌های اصلی معماری ایرانی RGN و مدل (های) هامان است. ما با این رویکرد تلاش کرده‌ایم ساختار، ارتباط و زمینه را به‌صورت هم‌زمان وارد فرایند مدل‌سازی زبان فارسی کنیم.

معماری بومی و ایرانی به معنای فاصله گرفتن از فناوری مدرن نیست

ما بومی‌سازی را به معنای کنار گذاشتن دستاوردهای مدرن حوزه هوش مصنوعی نمی‌دانیم. برعکس، هدف ما این است که فناوری‌های روز را در قالب یک معماری ایرانی، توسعه‌پذیر و متناسب با نیازهای زبان فارسی به کار بگیریم.

هسته مدل هامان از یک Transformer علّی و فقط‌رمزگشا تشکیل شده است. در این معماری از مؤلفه‌های مدرن مدل‌های زبانی از جمله RoPE برای کدگذاری موقعیت، SwiGLU در لایه‌های پیش‌خور، RMSNorm برای نرمال‌سازی و KV-cache برای بهینه‌سازی فرایند تولید متن استفاده شده است.

نسخه نخست هامان حدود ۱۲۵ میلیون پارامتر یکتا دارد و از ۱۰ لایه Transformer، ۱۲ سر توجه و یک توکن‌ساز فارسی با واژگان ۳۲ هزار توکنی بهره می‌برد.

زیرساخت RGN نیز تنها به یک نوع شبکه عصبی گرافی محدود نیست. این معماری قابلیت استفاده و توسعه با ساختارهای گرافی مختلف، از جمله GCN، GraphSAGE، GAT و RGCN را دارد.

این ویژگی‌ها نشان می‌دهند که RGN صرفاً یک نمونه آزمایشگاهی محدود نیست. ما آن را به‌عنوان یک زیرساخت مدرن و توسعه‌پذیر برای پژوهش، آموزش مدل و تولید نسل‌های آینده مدل‌های زبانی فارسی طراحی کرده‌ایم.

معماری مدرن ایرانی با گواهی دانش‌بنیان

یکی از نقاط مهم این پروژه، برخورداری زیرساخت RGN از گواهی دانش‌بنیان است.

محصول (RGN) Rakhshai Graph-based NLP که مدل هامان بر پایه آن توسعه یافته، به‌عنوان یک زیرساخت گراف‌محور پردازش زبان طبیعی فارسی، گواهی دانش‌بنیان دریافت کرده است.

این گواهی به محصول زیرساختی رخشای تعلق دارد و نشان‌دهنده آن است که معماری پایه پروژه، صرفاً یک طرح نظری یا یک آزمایش کوتاه‌مدت نیست. رخشای به‌عنوان یک محصول مهندسی‌شده، نوآورانه، مدرن و قابل‌توسعه در حوزه پردازش زبان فارسی شکل گرفته است.

ما در توسعه رخشای تلاش کرده‌ایم میان پژوهش، مهندسی نرم‌افزار و کاربرد صنعتی ارتباط برقرار کنیم. به همین دلیل، این زیرساخت علاوه بر معماری مدل، شامل ابزارهای آماده‌سازی داده، آموزش، ارزیابی، تولید متن، رابط خط فرمان، API پایتون و قابلیت اتصال به سامانه‌های مختلف هوش مصنوعی است.

هامان ۱۲۵M یکی از نخستین خروجی‌های مهم این معماری ایرانی و دانش‌بنیان است.

آموزش مدل از ابتدا با جریان کاری فارسی

مدل هامان ۱۲۵M با استفاده از مجموعه‌ای شامل حدود ۱۸۶ هزار مقاله فارسی ویکی‌پدیا آموزش دیده است. (لینک دیتاست هامان 125M)

در تقسیم‌بندی داده‌های منتشرشده، ۱۷۶٬۶۱۱ رکورد برای آموزش و ۹٬۲۹۵ رکورد برای اعتبارسنجی در نظر گرفته شده‌اند. مدل طی دو دوره آموزشی و با حدود ۳۹۶٫۹ میلیون مواجهه توکنی آموزش دیده است.

آموزش این نسخه از مدل روی پردازنده گرافیکی NVIDIA A100 با حافظه ۴۰ گیگابایت انجام شده است.

در این پروژه، توکن‌ساز فارسی، گراف پیکره، فرایند آماده‌سازی داده و وزن‌های مدل در قالب یک جریان کاری مستقل توسعه یافته‌اند. این استقلال به ما امکان می‌دهد در نسخه‌های بعدی، مدل را با داده‌های گسترده‌تر، گراف‌های غنی‌تر، معماری‌های پیشرفته‌تر و تعداد پارامترهای بیشتر توسعه دهیم.

برای ما، ارزش اصلی پروژه فقط در خروجی فعلی مدل خلاصه نمی‌شود. اهمیت واقعی آن در ایجاد توانایی بازتولید و ادامه مسیر است.

اکنون ما یک زنجیره در اختیار داریم که می‌تواند داده فارسی را دریافت کند، آن را پردازش کند، توکن‌ساز بسازد، گراف زبانی ایجاد کند، مدل را آموزش دهد، نتایج را ارزیابی کند و نسخه‌های بعدی را توسعه دهد.

این زیرساخت، پایه اصلی حرکت ما به سمت مدل‌های زبانی قدرتمندتر ایرانی است.

مدلی برای تولید ساختاریافته مقاله فارسی

نخستین نسخه هامان با تمرکز بر تولید ساختاریافته مقاله فارسی توسعه یافته است.

در این مدل، کاربر می‌تواند موضوع مقاله، نوع مخاطب، لحن متن و تعداد بخش‌های مورد نظر را مشخص کند. مدل نیز می‌تواند خروجی را در قالب‌هایی مانند Markdown یا JSON تولید کند.

انتخاب تولید مقاله به‌عنوان نخستین کاربرد، با هدف نمایش توانایی مدل در سازمان‌دهی متن، حفظ ساختار و تولید محتوای چندبخشی انجام شده است.

Haman Persian Article Graph-LLM 125M می‌تواند در پژوهش‌های مرتبط با مدل‌سازی زبان فارسی، آزمایش معماری‌های گراف‌محور، تولید محتوای ساختاریافته، ادامه پیش‌آموزش و توسعه ابزارهای نگارش فارسی مورد استفاده قرار گیرد.

البته ما این مدل را نقطه نهایی پروژه نمی‌دانیم. Haman Persian Article Graph-LLM 125M نخستین نسخه و نخستین گام از یک خانواده در حال توسعه است.

تأکید ما بر نخستین‌بودن این مدل، صرفاً به زمان انتشار آن مربوط نیست. اهمیت این مدل در آن است که نخستین LLM ایرانی معرفی‌شده با یک معماری طراحی و پیاده‌سازی‌شده در ایران محسوب می‌شود.

مدل‌های قدرتمندتر در راه هستند

Haman Persian Article Graph-LLM 125M آغاز مسیر خانواده مدل‌های زبانی هامان است.

ما برنامه داریم به‌مرور مدل‌های جدیدتر و قدرتمندتری را در این خانواده توسعه و منتشر کنیم. افزایش تعداد پارامترها، گسترش داده‌های آموزشی، افزایش طول زمینه، بهبود ساختار گراف، توسعه قابلیت‌های استدلالی و پشتیبانی از کاربردهای متنوع‌تر، بخشی از مسیر پیش روی ما خواهد بود.

بااین‌حال، توسعه مدل‌های زبانی بزرگ‌تر به زیرساخت محاسباتی قابل‌توجهی نیاز دارد.

پردازنده‌های گرافیکی قدرتمند، حافظه محاسباتی بالا، فضای ذخیره‌سازی مناسب، شبکه پرسرعت، انرژی پایدار و امکان اجرای دوره‌های طولانی آموزش، از الزامات ساخت مدل‌های بزرگ و رقابت‌پذیر هستند.

ما دانش معماری، زیرساخت نرم‌افزاری و جریان آموزش مورد نیاز برای ادامه این مسیر را ایجاد کرده‌ایم. سرعت حرکت به سمت مدل‌های قدرتمندتر، به میزان دسترسی به زیرساخت محاسباتی مناسب وابسته خواهد بود.

در صورت فراهم‌شدن این زیرساخت، مدل‌های بزرگ‌تر و توانمندتر خانواده هامان به‌مرور رونمایی خواهند شد.

انتشار عمومی و توسعه متن‌باز

ما مدل Haman Persian Article Graph-LLM 125M و زیرساخت (RGN) Rakhshai Graph-based NLP را به‌صورت عمومی منتشر کرده‌ایم تا پژوهشگران، توسعه‌دهندگان، دانشگاه‌ها و فعالان حوزه هوش مصنوعی بتوانند آن‌ها را بررسی، آزمایش و توسعه دهند.

متن‌بازبودن این پروژه برای ما یک تصمیم راهبردی است.

زبان فارسی برای رشد در حوزه هوش مصنوعی به مشارکت گسترده نیاز دارد. هیچ شرکت، دانشگاه یا تیمی به‌تنهایی نمی‌تواند تمام مسائل پردازش زبان فارسی را حل کند. ایجاد یک زیرساخت عمومی و قابل‌بررسی می‌تواند به انباشته‌شدن دانش فنی، افزایش همکاری‌های پژوهشی و شکل‌گیری محصولات جدید کمک کند.

ما امیدواریم (RGN) Rakhshai Graph-based NLP و خانواده مدل‌های هامان به بستری برای پژوهشگران، توسعه‌دهندگان مستقل، شرکت‌های فناوری و مراکز دانشگاهی تبدیل شوند و به توسعه بیشتر هوش مصنوعی فارسی کمک کنند.

مدل‌ها، مجموعه‌داده‌ها و نسخه‌های جدید خانواده هامان به‌مرور در صفحه رسمی ما در Hugging Face منتشر خواهند شد.

آغاز مسیری برای استقلال فناورانه زبان فارسی

این زنجیره از آماده‌سازی داده فارسی آغاز می‌شود، به ساخت توکن‌ساز و گراف زبانی می‌رسد، با ترکیب Transformer و شبکه عصبی گرافی ادامه پیدا می‌کند و در نهایت به آموزش و انتشار یک مدل زبانی بومی منجر می‌شود.

Haman Persian Article Graph-LLM 125M ، نخستین LLM ایرانی ساخته‌شده با معماری ایرانی است؛ معماری‌ای مدرن، گراف‌محور، فارسی‌محور و توسعه‌یافته بر پایه محصول دانش‌بنیان رخشای.

ما معتقدیم برای آنکه زبان فارسی در آینده هوش مصنوعی صرفاً مصرف‌کننده فناوری‌های خارجی نباشد، باید توانایی طراحی معماری، ساخت داده، آموزش مدل و توسعه زیرساخت را در داخل کشور ایجاد کنیم.

این مسیر با یک مدل آغاز شده است، اما به یک مدل محدود نخواهد ماند.

Haman Persian Article Graph-LLM 125M نخستین گام ما برای ساخت نسل جدید مدل‌های زبانی فارسی است. با فراهم‌شدن زیرساخت محاسباتی مناسب، مدل‌های قدرتمندتر خانواده هامان نیز به‌مرور معرفی و منتشر خواهند شد.


پیوندهای رسمی پروژه

صفحه مدل هامان ۱۲۵M:
Haman Persian Article Graph-LLM 125M

صفحه رسمی انتشار مدل‌ها و مجموعه‌داده‌های هامان:
Haman AI Lab در Hugging Face

مخزن معماری ایرانی رخشای:
Rakhshai Graph-based NLP در GitHub