گامی برای قدرتمندتر کردن زبان فارسی در عصر هوش مصنوعی
ما در شرکت دانشبنیان آریا هامان مهر پارسه، با افتخار مدل Haman Persian Article Graph-LLM 125M را بهعنوان نخستین LLM ایرانی ساختهشده با معماری ایرانی معرفی میکنیم.
هامان ۱۲۵M نخستین عضو از خانواده مدلهای زبانی هامان است ؛ خانوادهای که با هدف توسعه زیرساختهای بومی هوش مصنوعی، افزایش توان پردازش زبان فارسی و ایجاد تمرکز فناورانه در حوزه مدلهای زبانی طراحی شده است. این مدل، نقطه آغاز مسیری است که در ادامه آن، متناسب با فراهمشدن زیرساختهای محاسباتی مورد نیاز، مدلهای بزرگتر، پیشرفتهتر و قدرتمندتری نیز معرفی خواهند شد که بر مبنای معماری ایرانی با تمرکز بر زبان فارسی است .
آنچه Haman Persian Article را از بسیاری از مدلهای فارسی موجود متمایز میکند، تنها استفاده از دادههای فارسی نیست. معماری اصلی مدل، زیرساخت پردازش زبان، فرایند آمادهسازی داده، توکنسازی، ساخت گراف زبانی و آموزش مدل، همگی در داخل ایران طراحی و پیادهسازی شدهاند و معماری تولید ایرانی که توانسته گواهی دانش بنیان این معماری را دریافت کند .
به همین دلیل، هامان ۱۲۵M را صرفاً یک مدل فارسیسازیشده یا نسخهای تنظیمشده از یک مدل خارجی نمیدانیم؛ بلکه آن را نخستین LLM ایرانی مبتنی بر یک معماری بومی و ایرانی معرفی میکنیم.
مدل Haman Persian Article بر پایه معماری و زیرساخت ایرانی Rakhshai Graph-based NLP (RGN) توسعه یافته است.

زبان فارسی به معماری بومی و ایرانی نیاز دارد
ما معتقدیم برای قدرتمندتر کردن زبان فارسی در عصر هوش مصنوعی، صرفاً جمعآوری دادههای فارسی یا آموزش تکمیلی مدلهای خارجی کافی نیست. زبان فارسی برای حضور جدی، مستقل و پایدار در آینده هوش مصنوعی، به معماریهای بومی نیاز دارد.
در زمانی که تمام مدل های هوش مصنوعی در حال بهبود الگوریتم ها برای زبان های محلی کشور خود هستند ما اعتقاد داریم باید برای زبان فارسی نیز چهارچوبی متمرکز برای زبان فارسی وجود داشته باشد که بتواند تمرکز زیرساختی روی آن وجود داشته باشد .
به دلیل نبود این زیرساخت ما تمام مسیر از متن خام تا تولید و استفاده مدل llm و کلان داده را به صورت منبع باز و قابل توسعه در اختیار توسعه دهندگان و محققان قرار می دهیم .
هر زبان دارای ویژگیهای خاص خود است. ساختار جمله، روابط معنایی، شیوه نگارش، فاصله و نیمفاصله، صرف واژهها، ریشههای زبانی و ارتباط میان مفاهیم در زبان فارسی، با بسیاری از زبانهای دیگر تفاوت دارد. هنگامی که یک مدل عمومی خارجی برای دهها یا صدها زبان طراحی میشود، زبان فارسی معمولاً تنها یکی از زبانهای جانبی آن مدل است و الزاماً در مرکز تصمیمهای معماری قرار ندارد.
در مقابل، هنگامی که معماری از ابتدا با تمرکز بر زبان فارسی طراحی شود، میتوان ویژگیهای این زبان را در سطحی عمیقتر وارد فرایند مدلسازی کرد.
هدف ما از توسعه خانواده مدلهای هامان، تنها تولید متن فارسی نیست. ما در تلاش هستیم زیرساختی ایجاد کنیم که زبان فارسی در آن یک قابلیت فرعی نباشد، بلکه هسته اصلی معماری، داده، آموزش و توسعه مدل را تشکیل دهد.
از نگاه ما، آینده قدرتمند زبان فارسی در هوش مصنوعی، از مسیر سه مؤلفه عبور میکند:
داده فارسی، معماری ایرانی و زیرساخت محاسباتی مناسب.
Haman Persian Article Graph-LLM 125M نخستین گام عملی ما در این مسیر است.
نخستین LLM ایرانی با معماری طراحیشده در ایران
Haman Persian Article Graph-LLM 125M از ابتدا در یک زنجیره توسعه بومی و ایرانی شکل گرفته است. ما در این پروژه تلاش کردهایم اجزای اصلی مورد نیاز برای ساخت یک مدل زبانی فارسی را در قالب یک زیرساخت یکپارچه Rakhshai Graph-based NLP (RGN) توسعه دهیم.
این زنجیره شامل نرمالسازی و آمادهسازی متون فارسی، ساخت توکنساز، ایجاد گراف واژگانی، طراحی معماری مدل، آموزش، ارزیابی، ذخیره نقاط بازرسی و اجرای مدل است.
مدل Haman Persian Article با وزنهای تصادفی آموزش خود را آغاز کرده است. در فرایند ساخت آن از یک مدل زبانی پایه خارجی ازپیشآموزشدیده، وزنهای آماده، تعبیههای ازپیشآموزشدیده، تقطیر دانش یا دادههای مصنوعی تولیدشده توسط مدلهای زبانی خارجی استفاده نشده است.
این موضوع برای ما اهمیت ویژهای دارد؛ زیرا هدف اصلی پروژه فقط ارائه یک فایل مدل نبوده است. هدف ما ایجاد دانش، توانایی و زیرساخت لازم برای تولید مدلهای زبانی فارسی در داخل کشور است.
در واقع، Haman Persian Article نتیجه یک فرایند کامل بومی و ایرانی است؛ فرایندی که از طراحی معماری و آمادهسازی داده آغاز شده و تا آموزش و انتشار مدل ادامه پیدا کرده است.
معماری ایرانی «Rakhshai Graph-based NLP (RGN)»؛ زیرساخت اصلی توسعه هامان
مدل هامان بر پایه معماری و زیرساخت ایرانی (RGN) Rakhshai Graph-based NLP توسعه یافته است.
RGN یک زیرساخت گرافمحور برای پردازش زبان طبیعی فارسی است که با هدف ترکیب مدلهای زبانی مدرن و شبکههای عصبی گرافی طراحی شده است. این زیرساخت مجموعهای از ابزارهای مورد نیاز برای آمادهسازی متن، ساخت گراف، آموزش مدل، ارزیابی، تولید متن و توسعه کاربردهای پردازش زبان طبیعی را در اختیار ما قرار میدهد.
یکی از تفاوتهای مهم معماری RGN با مدلهای زبانی متداول، استفاده از ساختار گرافی در کنار ساختار دنبالهای متن است.
مدلهای زبانی رایج، متن را عمدتاً بهصورت یک دنباله از توکنها پردازش میکنند. در چنین رویکردی، هر توکن با توجه به توکنهای قبل یا اطراف خود تحلیل میشود. این روش بسیار قدرتمند است، اما همه روابط موجود در زبان الزاماً به ترتیب ظاهری واژهها محدود نمیشوند.
در زبان، میان واژهها روابط مختلفی وجود دارد. برخی واژهها بهطور مکرر در کنار یکدیگر ظاهر میشوند، برخی دارای ریشه مشترک هستند و برخی از نظر معنایی یا ساختاری با یکدیگر ارتباط دارند.
در معماری RGN، این روابط در قالب یک گراف زبانی نیز مدلسازی میشوند. سپس اطلاعات استخراجشده از گراف با اطلاعات بهدستآمده از Transformer ترکیب میشود.
این رویکرد به مدل اجازه میدهد علاوه بر ترتیب توکنها، ارتباط میان واژهها را نیز در فرایند یادگیری در نظر بگیرد.
ترکیب Transformer و شبکه عصبی گرافی
معماری RGN از ترکیب یک مدل زبانی مبتنی بر Transformer و یک شبکه عصبی گرافی استفاده میکند.
در این معماری، Transformer وظیفه پردازش دنباله متن و استخراج اطلاعات زمینهای را بر عهده دارد. در کنار آن، شبکه عصبی گرافی اطلاعات مربوط به روابط میان واژهها را از گراف زبانی دریافت و پردازش میکند.
در مرحله بعد، بازنمایی دنبالهای متن و بازنمایی گرافی واژهها با یکدیگر ترکیب میشوند.
این ترکیب بهصورت ثابت انجام نمیشود. معماری از یک سازوکار دروازهای مبتنی بر زمینه استفاده میکند تا مدل بتواند یاد بگیرد در هر موقعیت، چه میزان از اطلاعات Transformer و چه میزان از اطلاعات گراف استفاده کند.
به بیان سادهتر، مدل میتواند بر اساس متن و موقعیت هر واژه تصمیم بگیرد که در آن لحظه، ترتیب توکنها اهمیت بیشتری دارد یا روابط گرافی میان واژهها.
این ویژگی یکی از پایههای اصلی معماری ایرانی RGN و مدل (های) هامان است. ما با این رویکرد تلاش کردهایم ساختار، ارتباط و زمینه را بهصورت همزمان وارد فرایند مدلسازی زبان فارسی کنیم.
معماری بومی و ایرانی به معنای فاصله گرفتن از فناوری مدرن نیست
ما بومیسازی را به معنای کنار گذاشتن دستاوردهای مدرن حوزه هوش مصنوعی نمیدانیم. برعکس، هدف ما این است که فناوریهای روز را در قالب یک معماری ایرانی، توسعهپذیر و متناسب با نیازهای زبان فارسی به کار بگیریم.
هسته مدل هامان از یک Transformer علّی و فقطرمزگشا تشکیل شده است. در این معماری از مؤلفههای مدرن مدلهای زبانی از جمله RoPE برای کدگذاری موقعیت، SwiGLU در لایههای پیشخور، RMSNorm برای نرمالسازی و KV-cache برای بهینهسازی فرایند تولید متن استفاده شده است.
نسخه نخست هامان حدود ۱۲۵ میلیون پارامتر یکتا دارد و از ۱۰ لایه Transformer، ۱۲ سر توجه و یک توکنساز فارسی با واژگان ۳۲ هزار توکنی بهره میبرد.
زیرساخت RGN نیز تنها به یک نوع شبکه عصبی گرافی محدود نیست. این معماری قابلیت استفاده و توسعه با ساختارهای گرافی مختلف، از جمله GCN، GraphSAGE، GAT و RGCN را دارد.
این ویژگیها نشان میدهند که RGN صرفاً یک نمونه آزمایشگاهی محدود نیست. ما آن را بهعنوان یک زیرساخت مدرن و توسعهپذیر برای پژوهش، آموزش مدل و تولید نسلهای آینده مدلهای زبانی فارسی طراحی کردهایم.
معماری مدرن ایرانی با گواهی دانشبنیان
یکی از نقاط مهم این پروژه، برخورداری زیرساخت RGN از گواهی دانشبنیان است.
محصول (RGN) Rakhshai Graph-based NLP که مدل هامان بر پایه آن توسعه یافته، بهعنوان یک زیرساخت گرافمحور پردازش زبان طبیعی فارسی، گواهی دانشبنیان دریافت کرده است.
این گواهی به محصول زیرساختی رخشای تعلق دارد و نشاندهنده آن است که معماری پایه پروژه، صرفاً یک طرح نظری یا یک آزمایش کوتاهمدت نیست. رخشای بهعنوان یک محصول مهندسیشده، نوآورانه، مدرن و قابلتوسعه در حوزه پردازش زبان فارسی شکل گرفته است.
ما در توسعه رخشای تلاش کردهایم میان پژوهش، مهندسی نرمافزار و کاربرد صنعتی ارتباط برقرار کنیم. به همین دلیل، این زیرساخت علاوه بر معماری مدل، شامل ابزارهای آمادهسازی داده، آموزش، ارزیابی، تولید متن، رابط خط فرمان، API پایتون و قابلیت اتصال به سامانههای مختلف هوش مصنوعی است.
هامان ۱۲۵M یکی از نخستین خروجیهای مهم این معماری ایرانی و دانشبنیان است.
آموزش مدل از ابتدا با جریان کاری فارسی
مدل هامان ۱۲۵M با استفاده از مجموعهای شامل حدود ۱۸۶ هزار مقاله فارسی ویکیپدیا آموزش دیده است. (لینک دیتاست هامان 125M)
در تقسیمبندی دادههای منتشرشده، ۱۷۶٬۶۱۱ رکورد برای آموزش و ۹٬۲۹۵ رکورد برای اعتبارسنجی در نظر گرفته شدهاند. مدل طی دو دوره آموزشی و با حدود ۳۹۶٫۹ میلیون مواجهه توکنی آموزش دیده است.
آموزش این نسخه از مدل روی پردازنده گرافیکی NVIDIA A100 با حافظه ۴۰ گیگابایت انجام شده است.
در این پروژه، توکنساز فارسی، گراف پیکره، فرایند آمادهسازی داده و وزنهای مدل در قالب یک جریان کاری مستقل توسعه یافتهاند. این استقلال به ما امکان میدهد در نسخههای بعدی، مدل را با دادههای گستردهتر، گرافهای غنیتر، معماریهای پیشرفتهتر و تعداد پارامترهای بیشتر توسعه دهیم.
برای ما، ارزش اصلی پروژه فقط در خروجی فعلی مدل خلاصه نمیشود. اهمیت واقعی آن در ایجاد توانایی بازتولید و ادامه مسیر است.
اکنون ما یک زنجیره در اختیار داریم که میتواند داده فارسی را دریافت کند، آن را پردازش کند، توکنساز بسازد، گراف زبانی ایجاد کند، مدل را آموزش دهد، نتایج را ارزیابی کند و نسخههای بعدی را توسعه دهد.
این زیرساخت، پایه اصلی حرکت ما به سمت مدلهای زبانی قدرتمندتر ایرانی است.
مدلی برای تولید ساختاریافته مقاله فارسی
نخستین نسخه هامان با تمرکز بر تولید ساختاریافته مقاله فارسی توسعه یافته است.
در این مدل، کاربر میتواند موضوع مقاله، نوع مخاطب، لحن متن و تعداد بخشهای مورد نظر را مشخص کند. مدل نیز میتواند خروجی را در قالبهایی مانند Markdown یا JSON تولید کند.
انتخاب تولید مقاله بهعنوان نخستین کاربرد، با هدف نمایش توانایی مدل در سازماندهی متن، حفظ ساختار و تولید محتوای چندبخشی انجام شده است.
Haman Persian Article Graph-LLM 125M میتواند در پژوهشهای مرتبط با مدلسازی زبان فارسی، آزمایش معماریهای گرافمحور، تولید محتوای ساختاریافته، ادامه پیشآموزش و توسعه ابزارهای نگارش فارسی مورد استفاده قرار گیرد.
البته ما این مدل را نقطه نهایی پروژه نمیدانیم. Haman Persian Article Graph-LLM 125M نخستین نسخه و نخستین گام از یک خانواده در حال توسعه است.
تأکید ما بر نخستینبودن این مدل، صرفاً به زمان انتشار آن مربوط نیست. اهمیت این مدل در آن است که نخستین LLM ایرانی معرفیشده با یک معماری طراحی و پیادهسازیشده در ایران محسوب میشود.
مدلهای قدرتمندتر در راه هستند
Haman Persian Article Graph-LLM 125M آغاز مسیر خانواده مدلهای زبانی هامان است.
ما برنامه داریم بهمرور مدلهای جدیدتر و قدرتمندتری را در این خانواده توسعه و منتشر کنیم. افزایش تعداد پارامترها، گسترش دادههای آموزشی، افزایش طول زمینه، بهبود ساختار گراف، توسعه قابلیتهای استدلالی و پشتیبانی از کاربردهای متنوعتر، بخشی از مسیر پیش روی ما خواهد بود.
بااینحال، توسعه مدلهای زبانی بزرگتر به زیرساخت محاسباتی قابلتوجهی نیاز دارد.
پردازندههای گرافیکی قدرتمند، حافظه محاسباتی بالا، فضای ذخیرهسازی مناسب، شبکه پرسرعت، انرژی پایدار و امکان اجرای دورههای طولانی آموزش، از الزامات ساخت مدلهای بزرگ و رقابتپذیر هستند.
ما دانش معماری، زیرساخت نرمافزاری و جریان آموزش مورد نیاز برای ادامه این مسیر را ایجاد کردهایم. سرعت حرکت به سمت مدلهای قدرتمندتر، به میزان دسترسی به زیرساخت محاسباتی مناسب وابسته خواهد بود.
در صورت فراهمشدن این زیرساخت، مدلهای بزرگتر و توانمندتر خانواده هامان بهمرور رونمایی خواهند شد.
انتشار عمومی و توسعه متنباز
ما مدل Haman Persian Article Graph-LLM 125M و زیرساخت (RGN) Rakhshai Graph-based NLP را بهصورت عمومی منتشر کردهایم تا پژوهشگران، توسعهدهندگان، دانشگاهها و فعالان حوزه هوش مصنوعی بتوانند آنها را بررسی، آزمایش و توسعه دهند.
متنبازبودن این پروژه برای ما یک تصمیم راهبردی است.
زبان فارسی برای رشد در حوزه هوش مصنوعی به مشارکت گسترده نیاز دارد. هیچ شرکت، دانشگاه یا تیمی بهتنهایی نمیتواند تمام مسائل پردازش زبان فارسی را حل کند. ایجاد یک زیرساخت عمومی و قابلبررسی میتواند به انباشتهشدن دانش فنی، افزایش همکاریهای پژوهشی و شکلگیری محصولات جدید کمک کند.
ما امیدواریم (RGN) Rakhshai Graph-based NLP و خانواده مدلهای هامان به بستری برای پژوهشگران، توسعهدهندگان مستقل، شرکتهای فناوری و مراکز دانشگاهی تبدیل شوند و به توسعه بیشتر هوش مصنوعی فارسی کمک کنند.
مدلها، مجموعهدادهها و نسخههای جدید خانواده هامان بهمرور در صفحه رسمی ما در Hugging Face منتشر خواهند شد.
آغاز مسیری برای استقلال فناورانه زبان فارسی
ما Haman Persian Article Graph-LLM 125M را تنها یک مدل ۱۲۵ میلیون پارامتری نمیدانیم. این مدل برای ما اثبات امکان ایجاد یک زنجیره کامل ایرانی در حوزه مدلهای زبانی است.
این زنجیره از آمادهسازی داده فارسی آغاز میشود، به ساخت توکنساز و گراف زبانی میرسد، با ترکیب Transformer و شبکه عصبی گرافی ادامه پیدا میکند و در نهایت به آموزش و انتشار یک مدل زبانی بومی منجر میشود.
Haman Persian Article Graph-LLM 125M ، نخستین LLM ایرانی ساختهشده با معماری ایرانی است؛ معماریای مدرن، گرافمحور، فارسیمحور و توسعهیافته بر پایه محصول دانشبنیان رخشای.
ما معتقدیم برای آنکه زبان فارسی در آینده هوش مصنوعی صرفاً مصرفکننده فناوریهای خارجی نباشد، باید توانایی طراحی معماری، ساخت داده، آموزش مدل و توسعه زیرساخت را در داخل کشور ایجاد کنیم.
این مسیر با یک مدل آغاز شده است، اما به یک مدل محدود نخواهد ماند.
Haman Persian Article Graph-LLM 125M نخستین گام ما برای ساخت نسل جدید مدلهای زبانی فارسی است. با فراهمشدن زیرساخت محاسباتی مناسب، مدلهای قدرتمندتر خانواده هامان نیز بهمرور معرفی و منتشر خواهند شد.
پیوندهای رسمی پروژه
صفحه مدل هامان ۱۲۵M:
Haman Persian Article Graph-LLM 125M
صفحه رسمی انتشار مدلها و مجموعهدادههای هامان:
Haman AI Lab در Hugging Face
مخزن معماری ایرانی رخشای:
Rakhshai Graph-based NLP در GitHub