از زبان فارسی به گراف معنا، از گراف معنا به اولین مدلهای زبانی ایرانی با معماری ایرانی
زبان فارسی برای حضور مؤثر در عصر هوش مصنوعی، به چیزی فراتر از ترجمه رابطهای کاربری یا افزودن چند مجموعهداده فارسی به مدلهای موجود نیاز دارد. مدلهای هوش مصنوعی باید بتوانند ساختار واژهها، پیوند میان جملهها، وابستگیهای نحوی، ارتباط اسناد، زمینههای فرهنگی و رابطه میان مفاهیم فارسی را بهتر درک کنند. تحقق این هدف، بدون ایجاد زیرساختی که از ابتدا برای زبان فارسی طراحی شده باشد، دشوار خواهد بود.

ما در آزمایشگاه هوش مصنوعی هامان ـ Haman Labs، با آدرس اینترنتی : www.hamanlabs.ir وابسته به شرکت دانشبنیان نرمافزاری آریا هامان مهر پارسه، این مسیر را با ساخت یک زیرساخت فارسیمحور، گرافمحور و متنباز آغاز کردهایم. این زیرساخت، متن خام فارسی را به گرافی زنده از واژهها، جملهها، اسناد، معناها و رابطهها تبدیل میکند و سپس از این گراف در آموزش، تحلیل، استنتاج و تولید متن بهره میگیرد. هدف ما ایجاد بستری برای انتشار اولین مدلهای زبانی ایرانی مبتنی بر معماری ایرانی، توسعه ابزارهای تخصصی زبان فارسی و فراهمکردن امکان استفاده مدلهای بزرگ داخلی و بینالمللی از شواهد زبانی غنیتر فارسی است.
آزمایشگاه هوش مصنوعی هامان قرار است سکوی انتشار نسل تازهای از مدلهای زبانی ایرانی باشد؛ مدلهایی که صرفاً پوستهای بر یک مدل آماده خارجی نیستند، بلکه توکنساز، گراف زبانی، موتور آموزش، حافظه، خط تولید داده و سازوکار استنتاج آنها با تمرکز بر ویژگیهای زبان فارسی توسعه یافته است.
مأموریت ما؛ قدرتبخشیدن به زبان فارسی در عصر مدلهای بزرگ
مأموریت ما فقط ساخت یک نرمافزار پردازش متن یا یک مدل تولید محتوا نیست. ما در حال ایجاد زیرساختی هستیم که بتواند به یکی از پایههای فنی هوش مصنوعی فارسی تبدیل شود؛ زیرساختی که پژوهشگران، دانشگاهها، توسعهدهندگان، شرکتها و تیمهای محصول بتوانند بر مبنای آن مدلها و خدمات تازهای بسازند.
در این مسیر، سه اصل راهنمای ماست:
نخست، مدل باید رابطه میان عناصر زبان را در کنار توالی کلمات ببیند. متن فارسی فقط مجموعهای از واژههای پشتسرهم نیست؛ معنا از ارتباط واژهها با یکدیگر، نقش آنها در جمله، شباهت اسناد، موضوع متن و پیوند مفاهیم شکل میگیرد.
دوم، زیرساخت باید بومی، قابلتکرار و قابلتوسعه باشد. از نرمالسازی متن و توکنسازی تا ساخت گراف، آموزش، ارزیابی و استنتاج، اجزای اصلی باید در اختیار جامعه فنی قرار داشته باشند.
سوم، این دانش باید به شکل متنباز و جامعهمحور منتشر شود تا مسیر پژوهش و ساخت محصول برای فعالان هوش مصنوعی فارسی کوتاهتر شود. ما میخواهیم دانشی که در زبان و فرهنگ ایران ریشه دارد، در عین حفظ هویت خود، با ابزارها و استانداردهای جهانی تعامل کند.
RGN چیست؟
هسته فنی این مسیر، سکوی Rakhshai Graph-based NLP یا RGN است؛ زیرساخت متنباز ما برای پردازش زبان طبیعی فارسی، ساخت گرافهای زبانی و توسعه مدلهای زبانی گرافمحور.
ما RGN را بهعنوان یک سکوی یکپارچه NLP گرافمحور برای زبان فارسی ایجاد کردهایم. این سکو، مسیر حرکت از داده خام فارسی تا مدل و محصول قابلاستقرار را در یک مجموعه منسجم از ابزارهای پایتون، رابط خط فرمان، رابط وب و اتصال MCP فراهم میکند. در RGN میتوان داده را آماده کرد، گراف ساخت، مدلهای عصبی گرافی را آموزش داد، یک مدل زبانی بومی ایجاد کرد، نتایج را ارزیابی کرد و خروجی را در اختیار یک نرمافزار، چتبات، عامل هوش مصنوعی یا گردشکار سازمانی قرار داد.
به زبان ساده، RGN متن فارسی را از حالت یک رشته خطی از کلمات خارج میکند و آن را به شبکهای از ارتباطها تبدیل میسازد. در این شبکه، واژهها، جملهها، اسناد، موضوعها و مفهومها میتوانند بهصورت گره نمایش داده شوند و رابطههایی مانند همرخدادی، وابستگی نحوی، شباهت معنایی، تعلق واژه به سند و ارتباط موضوع با سند، به شکل یال میان آنها قرار گیرند.
چهار لایه بههمپیوسته برای ساخت هوش مصنوعی فارسی
معماری محصولی RGN از چهار لایه اصلی تشکیل شده است که میتوان آنها را جداگانه یا در کنار یکدیگر به کار گرفت.
پردازش فارسی
لایه نخست، مسئول آمادهسازی زبان فارسی است. این بخش نرمالسازی نویسهها، پاکسازی متن، توکنسازی، تحلیل زبانی و تولید ویژگیهای قابلاستفاده در مدلها را انجام میدهد. هدف این است که تفاوت نویسههای عربی و فارسی، نیمفاصله، علائم نگارشی، اعداد، همزه، اضافه و دیگر ویژگیهای نوشتاری فارسی بهصورت کنترلشده مدیریت شوند.
هوشمندی گرافی
در لایه دوم، متن به انواع گرافهای زبانی تبدیل میشود. گراف همرخدادی واژهها، گراف واژه ـ سند، گراف شباهت اسناد، گراف وابستگی نحوی، گراف معنایی و گراف چندرابطهای از جمله ساختارهایی هستند که میتوان در این بخش ایجاد کرد.
موتور بومی مدل
لایه rakhshai_graph_nlp.lm موتور سطح پایین و قابلاستفاده مجدد RGN است. توکنساز، ساخت داده مدل زبانی، رمزگذار گراف، مدل زبانی علّی، حافظه گراف، آموزش، ارزیابی، تولید متن و مدیریت چکپوینتها در این بخش قرار دارند.
گردشکارهای محصولی
لایه rakhshai_graph_nlp.llm مجموعهای از گردشکارهای سطح بالاتر برای ساخت محصولات مشخص است. نخستین گردشکار این لایه، llm.article است که فرایند آمادهسازی داده، ممیزی، آموزش، آزمونهای تفکیکی و تولید مقاله ساختاریافته فارسی را پوشش میدهد. جداسازی این دو لایه باعث میشود موتور اصلی Graph-LM برای کاربردهای مختلف قابلاستفاده باقی بماند و در عین حال، تیمهای محصول به رابطها و خروجیهای پایدار و کاربردمحور دسترسی داشته باشند.
RGN از متن خام تا محصول چه مسیری را طی میکند؟
در RGN، یک گردشکار کامل میتواند با دریافت مجموعهای از متون فارسی آغاز شود. متنها ابتدا پاکسازی، یکدست و توکنسازی میشوند. سپس از رابطههای موجود در آنها گرافهای ساده یا چندرابطهای ساخته میشود. شبکههای عصبی گرافی روی این ساختارها آموزش میبینند و بازنمایی حاصل از گراف با بازنمایی توکنهای مدل زبانی ترکیب میشود.
این زیرساخت، علاوه بر آموزش مدل، مسیر ارزیابی، پیشبینی، استنتاج، خلاصهسازی، طبقهبندی، بازیابی حافظه، تولید متن و ذخیره کامل خروجیهای اجرای مدل را نیز پوشش میدهد. نتیجه میتواند از طریق API پایتون، رابط خط فرمان، رابط وب یا MCP در اختیار محصول نهایی قرار گیرد.
به این ترتیب، RGN فقط یک کتابخانه ساخت گراف یا یک مدل زبانی منفرد نیست؛ بلکه زنجیرهای یکپارچه برای تبدیل داده فارسی به قابلیت هوشمند قابلاستقرار است.
نگاه تخصصی به معماری RGN
چرا گراف؟
مدلهای زبانی متعارف، متن را عمدتاً بهصورت دنبالهای از توکنها پردازش میکنند. این روش برای یادگیری بسیاری از الگوهای زبانی مؤثر است، اما همه ساختارهای معنایی و ارتباطی متن لزوماً در فاصله خطی توکنها آشکار نمیشوند.
در زبان فارسی، ارتباط یک واژه با واژههای همرخداد، نقش نحوی آن، حضورش در اسناد مختلف، شباهت موضوعی متنها و پیوند آن با مفهومهای دیگر میتواند اطلاعات مهمی درباره معنا فراهم کند. گراف این رابطهها را به ساختاری صریح تبدیل میکند تا مدل بتواند علاوه بر توالی، شبکه ارتباطی متن را نیز مشاهده کند.
برای نمونه، در رویکرد TextGCN میتوان واژهها و اسناد را به گره تبدیل کرد، ارتباط واژهها را با PMI و ارتباط واژه و سند را با TF-IDF وزن داد و سپس با استفاده از مدلهایی مانند GCN یا GAT اطلاعات را در شبکه منتشر کرد. به این ترتیب، هر متن جدا از مجموعه دیده نمیشود؛ بلکه بخشی از یک شبکه بزرگتر از زبان و اسناد است.
مسیر فنی Graph-LM
مسیر اصلی مدل زبانی در RGN بهصورت زیر طراحی شده است:
متن فارسی ← توکنساز فارسی ← داده مدل زبانی ← گراف چندرابطهای فارسی ← رمزگذار گراف RGN ← همجوشی تطبیقی گراف و متن ← موتور آموزش کمداده ← حافظه گراف وابسته به درخواست ← ترنسفورمر علّی ← تولید متن
این معماری میتواند در سه حالت قابلمقایسه اجرا شود: ترنسفورمر بدون گراف، مدل دارای گراف ساده همرخدادی و مدل چندرابطهای کامل. در هر سه حالت، توکنساز، داده آموزشی، زیان اصلی مدل زبانی، قالب چکپوینت و رابط تولید ثابت میماند و فقط اجزای مرتبط با گراف تغییر میکنند. این طراحی امکان اجرای آزمونهای تفکیکی و اندازهگیری نقش واقعی گراف را فراهم میسازد.
مدل زبانی پایه از معماری decoder-only استفاده میکند. در هسته فعلی، مؤلفههایی مانند RoPE، SwiGLU، RMSNorm و KV-cache نیز در مسیر مدل علّی در نظر گرفته شدهاند. در کنار آن، رمزگذار گرافی اطلاعات ساختاری را پردازش میکند و نتیجه از طریق سازوکار همجوشی قابلیادگیری وارد بازنمایی نهایی توکن میشود.
توکنساز فارسی؛ نقطه آغاز فهم دقیقتر زبان
یکی از اجزای پایه RGN، توکنساز فارسی آن است. این توکنساز برای مدیریت ویژگیهایی طراحی شده که در بسیاری از پردازشگرهای عمومی میتوانند موجب پراکندگی یا از بین رفتن اطلاعات شوند.
در این بخش، نویسههایی مانند «ي» و «ك» به شکل فارسی «ی» و «ک» تبدیل میشوند. نحوه برخورد با نیمفاصله قابل تنظیم است. اعداد فارسی و عربی و جداکنندههای اعشاری و هزارگان نرمال میشوند و علائم نگارشی فارسی و لاتین بهعنوان توکنهای مستقل حفظ میشوند تا مرز جمله و ساختار نوشتاری از بین نرود. مدیریت همزه و اضافه، جداسازی سبک برخی پیشوندها و پسوندها و اتصال اختیاری فعلهای مرکب نیز در این مسیر پیشبینی شده است.
RGN از حالتهای word، char_chunk، BPE و Unigram پشتیبانی میکند. حالت Unigram، مسیر عملیاتی پیشفرض معرفی شده و با استفاده از قطعههای زیرواژهای و پوشش نویسهای، برای کاهش واژههای خارج از واژگان در متن فارسی طراحی شده است.
گراف چندرابطهای فارسی
در معماری RGN، گراف صرفاً مجموعهای از یالهای مشابه نیست. هر نوع رابطه میتواند کانال مستقل خود را داشته باشد و مدل تفاوت میان رابطههای زبانی را بیاموزد.
گراف پیشفرض Graph-LM میتواند رابطههای زیر را در بر گیرد:
همرخدادی، PMI، وابستگی نحوی، اشتراک ریشه یا بن، ارتباط زیرواژهها، ارتباط واژه با سند و ارتباط موضوع با سند.
ساختار گراف میتواند شامل یالهای موازی باشد؛ یعنی دو گره، در صورت داشتن چند نوع رابطه، برای هر رابطه یک یال مستقل دریافت کنند. این ویژگی اجازه میدهد مدل فقط از وجود ارتباط مطلع نشود، بلکه نوع و وزن آن را نیز در فرایند یادگیری لحاظ کند.
هسته استدلال گرافی
RGN از رمزگذارهای گرافی GCN، GraphSAGE، GAT و RGCN پشتیبانی میکند.
GCN اطلاعات همسایهها را در ساختار گراف تجمیع میکند. GraphSAGE برای یادگیری بر اساس همسایگی و تعمیم به ساختارهای بزرگتر مناسب است. GAT با سازوکار توجه، وزن متفاوتی به همسایهها میدهد. RGCN نیز برای پردازش مستقیم انواع مختلف رابطه طراحی شده است.
در حالت رابطهمحور، شناسه رابطه میتواند به شکل یک بایاس قابلیادگیری، یک embedding یال یا مسیر مستقیم RGCN در مدل مصرف شود. وزن یال نیز در انتقال پیام دخالت دارد؛ بنابراین رابطهای مانند PMI، فاصله همرخدادی یا وزن تنظیمشده یک رابطه معنایی میتواند تأثیر متفاوتی بر خروجی داشته باشد.
همجوشی تطبیقی گراف و متن
یکی از مؤلفههای اصلی معماری RGN، ترکیب تطبیقی بازنمایی متنی و گرافی است. در این سازوکار، میزان استفاده از گراف بهصورت ثابت و دستی تعیین نمیشود. مدل یاد میگیرد در هر زمینه چه اندازه به embedding متنی و چه اندازه به embedding حاصل از گراف اعتماد کند.
این همجوشی میتواند در سه سطح انجام شود:
در سطح توکن، برای هر موقعیت از دنباله تصمیمگیری میشود؛ در سطح جمله، قدرت کلی سیگنال گراف در زمینه کنترل میشود؛ و در سطح زیرگراف، خلاصهای از گرههای غیرتوکنی مانند اسناد یا موضوعها در اختیار مدل قرار میگیرد.
این طراحی به مدل اجازه میدهد هنگام تولید یا تحلیل متن، در بخشهایی که رابطههای گرافی مفید هستند از آنها بهره بیشتری بگیرد و در موارد دیگر بر بازنمایی زبانی تکیه کند.
آموزش چندوظیفهای و موتور آموزش کمداده
آموزش Graph-LM در RGN فقط به پیشبینی توکن بعدی محدود نیست. در صورت وجود داده و گراف لازم، سیگنالهای دیگری مانند پیشبینی توکن پوشاندهشده، پیشبینی یال و همسایه، تشخیص نوع رابطه و همترازی بازنمایی متن، جمله و گراف نیز میتوانند در فرایند آموزش مشارکت کنند.
برای مجموعهدادههای کوچکتر فارسی، Low-Data Training Engine در نظر گرفته شده است. این بخش از افزایش داده متنی در مجموعه آموزش، حذف تصادفی یال یا گره، نمونهبرداری زیرگراف، زیان سازگاری contrastive، مرتبسازی curriculum و توقف زودهنگام بر اساس اعتبارسنجی استفاده میکند. داده اعتبارسنجی افزایش داده نمیشود و توکنساز نیز پیش از افزودن نمونههای تغییریافته روی داده اصلی آموزش ساخته میشود تا کنترل نشت اطلاعات حفظ شود.
همچنین امکان اجرای مدل بدون گراف وجود دارد تا پژوهشگر یا تیم توسعه بتواند نتایج مدل پایه و مدل گرافمحور را با شرایط یکسان مقایسه کند.
حافظه گراف وابسته به درخواست
در زمان تولید، استفاده از کل یک گراف بزرگ میتواند باعث ورود اطلاعات نامرتبط و افزایش هزینه محاسباتی شود. RGN برای حل این مسئله از Graph Memory وابسته به درخواست استفاده میکند.
در این مسیر، توکنها و مفاهیم موجود در درخواست به گرههای حافظه متصل میشوند. گرهها و همسایههای مرتبط بر اساس نوع و وزن رابطه امتیاز میگیرند و یک زیرگراف محدود برای همان درخواست ساخته میشود. سپس فقط این زمینه مرتبط در اختیار Graph-LM قرار میگیرد.
تعداد گرهها، عمق گسترش، سقف یالها، حداقل امتیاز و وزن رابطهها قابل تنظیم است. همچنین میتوان گزارشی ساختاریافته از گرهها، رابطهها و میزان پوشش حافظه بازیابیشده دریافت کرد. این سازوکار هم برای تولید متن و هم برای توضیحپذیری و اتصال مدل به عاملهای هوش مصنوعی اهمیت دارد.
مدل مقالهنویسی فارسی اولین از خانواده LLM های هامان
نخستین LLM ایرانی ساخته ش
نخستین خروجی شاخص این زیرساخت، مدل Haman Persian Article Graph-LLM 125M است که در ۲۴ تیر ۱۴۰۵، برابر با ۱۵ ژوئیه ۲۰۲۶، رونمایی شد.
ما مدل هامان را بهعنوان نخستین مدل زبانی ایرانی توسعهیافته با معماری ایرانی معرفی کردهایم. این مدل، یک Transformer از نوع decoder-only را با یک GCN واژگانی در سطح پیکره و سازوکار همجوشی زمینهمحور گراف و توکن ترکیب میکند. وزنهای مدل از مقداردهی اولیه تصادفی آموزش دیدهاند و توکنساز، گراف و خط تولید آموزشی آن برای زبان فارسی ساخته شدهاند.
مدل هامان با دریافت موضوع، نوع مخاطب، لحن و تعداد بخشها، مقالهای ساختاریافته تولید میکند. خروجی میتواند بهصورت Markdown برای انتشار یا JSON برای استفاده در نرمافزارها و گردشکارهای خودکار دریافت شود.
این مدل یک مدل پایه مقالهنویسی است و در نسخه فعلی بهعنوان چتبات، سامانه پاسخگویی قطعی یا مرجع تشخیص واقعیت طراحی نشده است. خروجیهای آن باید پیش از انتشار بازبینی شوند. کیفیت تولید نیز به داده آموزش، تنظیمات تولید، توکنساز، چکپوینت، رمزگذار گراف و شیوه همجوشی وابسته است.
خط تولید بومی مقاله
گردشکار مقالهنویسی هامان از پنج مرحله اصلی تشکیل شده است.
در مرحله article-prepare، دادههای TXT، JSONL، CSV یا TSV دریافت، نرمالسازی و به قالب مناسب آموزش مقاله تبدیل میشوند. رکوردهای کوتاه یا نامعتبر جدا میشوند و فایلهای پیکره، آموزش، اعتبارسنجی، دادههای پذیرفتهشده، دادههای ردشده و manifest ساخته میشوند.
در article-audit، کیفیت پیکره، پوشش نویسههای فارسی، خطر تکرار، پوشش منبع و فراداده و رفتار توکنساز بررسی میشود.
مرحله article-train مدل مقالهمحور را آموزش میدهد و علاوه بر وزنها، تنظیمات مدل، توکنساز، گراف، حافظه گراف، تنظیمات تولید و معیارهای آموزش را ذخیره میکند.
در article-ablation میتوان حالتهای بدون گراف و گرافدار، انواع رابطه و دامنههای مختلف گراف را مقایسه کرد.
در نهایت، article-generate چکپوینت را بارگذاری میکند و مقاله فارسی را بر اساس موضوع، مخاطب، لحن و ساختار درخواستی بهصورت Markdown یا JSON تحویل میدهد.
این تفکیک به ما اجازه میدهد مدل مقالهنویسی یک محصول مشخص باشد، بدون آنکه موتور عمومی Graph-LM به همان کاربرد محدود شود.
دیتاست مقالههای فارسی هامان
داده آموزشی منتشرشده برای این مسیر، مجموعه Haman Persian Wikipedia Articles 186K است. این مجموعه شامل ۱۸۶ هزار مقاله فارسی است و مسیر آمادهسازی داده مدل هامان را قابلمشاهده و تکرار میکند.
دادهها با فیلدهای عنوان و متن دریافت و به JSONL تبدیل میشوند. سپس گردشکار article-prepare آنها را با قالب wikipedia_prompt پردازش میکند و فایلهای corpus.txt، train.txt، validation.txt، رکوردهای پذیرفتهشده و ردشده و manifest.json را میسازد.
وزنهای مدل، دیتاست و نوتبوک آموزشی قابلتکرار بهصورت عمومی منتشر شدهاند تا توسعهدهندگان بتوانند مدل را اجرا کنند، مسیر آموزش را مطالعه کنند یا گردشکار مشابهی را روی پیکره اختصاصی خود بسازند.
مسیر بومی موتور مدل زبانی بدون اتکا به مدل زبانی خارجی ازپیشآموزشدیده، embedding آماده، distillation یا داده مصنوعی تولیدشده با LLM طراحی شده است.
اتصال RGN به عاملها و مدلهای بزرگ
MCP؛ پلی میان زیرساخت فارسی و اکوسیستم هوش مصنوعی
Model Context Protocol یا MCP یک لایه اتصال استاندارد پیرامون هسته RGN است. این لایه معماری اصلی را تغییر نمیدهد، بلکه قابلیتهای پردازش فارسی، ساخت گراف، خلاصهسازی، حافظه، تولید و توضیحپذیری را در اختیار عاملها، محیطهای توسعه، چتباتها و گردشکارهای خودکار قرار میدهد.
مسیر مفهومی MCP در RGN چنین است:
متن فارسی ← گراف دانش ← استدلال گرافی ← حافظه گراف ← خروجی توضیحپذیر
یک عامل هوش مصنوعی میتواند متن را برای تحلیل به RGN ارسال کند، کلیدواژهها و مفاهیم را دریافت کند، گراف دانش بسازد، زمینه مرتبط را از حافظه گراف بازیابی کند و سپس شواهد حاصل را برای تولید پاسخ یا انجام مرحله بعدی یک گردشکار به کار گیرد.
منابع MCP به مسیرهای از پیش مجاز محدود شدهاند و دسترسی دلخواه به فایلهای سامانه در اختیار عامل قرار نمیگیرد. منابع مدل، گراف و اجرای آزمایش فقطخواندنی هستند. در نسخه نخست، اجرای shell، حذف فایل، نصب بسته، نوشتن دلخواه و آموزش مستقیم مدل از طریق MCP ارائه نشده است. ورودیها نیز از نظر طول متن، تعداد اسناد و اندازه گراف خروجی محدود میشوند.
کمک به درک بهتر فارسی در مدلهای بینالمللی
چشمانداز آزمایشگاه هامان به ساخت مدلهای داخلی محدود نیست. RGN میتواند بهعنوان لایهای از شواهد، حافظه و زمینه فارسی در کنار مدلهای بزرگ بینالمللی نیز قرار گیرد.
در این حالت، مدل بینالمللی جایگزین نمیشود؛ بلکه پیش از پاسخگویی، اطلاعات ساختاریافتهای درباره روابط واژگانی، مفاهیم، گرههای مهم و مسیرهای ارتباطی متن فارسی دریافت میکند. هدف ما این است که مدلهای بزرگ نیز بتوانند هنگام کار با زبان فارسی به زمینهای فراتر از متن خطی دسترسی داشته باشند و کاربران فارسیزبان پاسخهایی مرتبطتر، مستندتر و قابلتوضیحتر دریافت کنند.
آزمایش تحلیل شعر فارسی
برای نمایش این مسیر، یک آزمایش زنده و قابلبازتولید روی تحلیل یک شعر فارسی انجام شد. شعر و پرسش یکسان در دو حالت در اختیار GPT-5.4 قرار گرفت: یکبار بهصورت مستقیم و یکبار همراه با شواهد گرافی تولیدشده از طریق RGN MCP.
در معیار خودکار، پاسخ مجهز به MCP چهار نشانه مرتبط را در برابر یک نشانه در حالت مستقیم به کار گرفت؛ یعنی چهار برابر شواهد مرتبط بیشتر. در امتیازدهی دستی نیز امتیاز از ۲۱ به ۲۵ رسید که معادل حدود ۱۹ درصد بهبود گزارش شد. معیارهای امتیازدهی شامل دقت تفسیر، وفاداری به متن، کیفیت ارتباط نمادها، استفاده از شواهد و کیفیت توضیح بود.
این نتیجه مربوط به یک آزمایش تکنمونهای است و جای ارزیابی گسترده روی مجموعهای متنوع از شعرها و متون فارسی را نمیگیرد. ما این آزمایش را نشانهای از ظرفیت مسیر گرافمحور میدانیم و توسعه ارزیابیهای جامع، تفکیکشده و قابلتکرار فارسی را بخشی از برنامه آینده خود قرار دادهایم.
ابزارهای توسعه و استقرار
RGN برای گروههای مختلف توسعهدهندگان چند مسیر دسترسی فراهم میکند.
API پایتون برای استفاده مستقیم از توکنساز، سازندههای گراف، مدلهای گرافی، Graph-LM، حافظه، آموزش و وظایف کاربردی در دسترس است.
ابزار خط فرمان rgnn-cli مسیرهای طبقهبندی گرافی، ساخت و آموزش مدل زبانی، ارزیابی، تولید متن و گردشکار مقاله را پوشش میدهد.
رابط وب فارسی و راستبهچپ امکان مشاهده و اجرای بخشهای اصلی پروژه را بدون نیاز به نوشتن مستقیم کد فراهم میکند. در بخش کامل رابط، کاربر میتواند از یک پیکره خام آغاز کند، گراف چندرابطهای را مشاهده کند، Graph-LM را آموزش دهد و با استفاده از مدل و حافظه گرافی متن تولید کند.
اتصال MCP نیز قابلیتهای پروژه را برای عاملها، محیطهای توسعه، چتباتها و سامانههای خودکار قابل فراخوانی میسازد.
مسیرهای آموزش روی CPU و GPU پشتیبانی میشوند. برای مجموعهدادههای بزرگتر نیز امکاناتی مانند ساخت دستهای آمار گراف، cache قابلاستفاده مجدد، محدودسازی تعداد همسایهها، DataLoader چندپردازه، mixed precision روی CUDA و ادامه آموزش از چکپوینت در نظر گرفته شده است.
کاربردهای RGN
RGN یک زیرساخت عمومی برای ساخت محصولات مختلف فارسی است. مدل مقالهنویسی هامان تنها نخستین نمونه از تبدیل این معماری به یک محصول مشخص به شمار میرود.
از این سکو میتوان برای طبقهبندی خبر، پیام، نظر کاربران و محتوای شبکههای اجتماعی استفاده کرد. خلاصهسازی استخراجی میتواند جملههای مهم را با روشهای مبتنی بر TextRank یا رتبهبندی گرافی انتخاب کند. توصیهگر محتوا میتواند اسناد نزدیک به یک متن یا پرسوجو را پیدا کند. گرافهای معنایی نیز میتوانند ارتباط میان واژهها و مفاهیم فارسی را آشکار سازند.
استخراج کلیدواژه، مفهوم و موجودیت، تحلیل معنایی، ساخت گراف دانش، بازیابی از حافظه، تولید متن با شواهد، تحلیل شبکه و ساخت embedding گرهها از دیگر مسیرهای قابلاستفاده هستند. اجزایی برای تشخیص نفرتپراکنی نیز در مخزن وجود دارد، هرچند استفاده از چنین طبقهبندهای حساسی نیازمند داده نماینده، تحلیل خطا و کنترل سوگیری است.
این قابلیتها میتوانند در پژوهش و گردآوری شواهد، دستیارهای برنامهنویسی، تحلیل و خلاصهسازی اسناد، چتباتهای سازمانی، پشتیبانی مشتریان و خودکارسازی گردشکارها مورد استفاده قرار گیرند.
متنباز، قابلتکرار و آماده مشارکت
کد منبع RGN تحت مجوز MIT منتشر شده است. معماری، رابط پایتون، ابزار خط فرمان، رابط وب، مستندات، تستها و مسیرهای ساخت مدل در مخزن پروژه در دسترس جامعه قرار دارند.
وزنهای مدل هامان در مخزن مستقل مدل نگهداری میشوند و از Haman Model License 1.0 استفاده میکنند. دیتاست مقالههای فارسی هامان نیز با مجوز CC BY-SA 4.0 منتشر شده است. این تفکیک اجازه میدهد کد، وزنهای نسخهبندیشده و داده آموزشی هرکدام با ساختار مناسب خود نگهداری و توزیع شوند.
پروژه همراه با تستهای واحد، یکپارچه، CLI، چکپوینت، گراف و آزمونهای end-to-end منتشر میشود. مجموعهدادههای کوچک نیز برای بررسی محلی پیادهسازی و اجرای تکرارپذیر در مخزن قرار گرفتهاند. گزارش معیارها، تنظیمات مدل، توکنساز، گراف، حافظه و وضعیت آموزش در خروجیهای چکپوینت ذخیره میشوند تا مسیر آزمایش تا حد امکان قابلبررسی باقی بماند.
افق توسعه آزمایشگاه هوش مصنوعی هامان
RGN برای ما نقطه پایان نیست؛ پایهای برای توسعه نسل تازهای از هوش مصنوعی فارسی است.
در مرحله کنونی، تمرکز بر نرمالسازی و توکنسازی فارسی، گرافهای چندرابطهای، مدلهای عصبی گرافی، طبقهبندی، خلاصهسازی، تحلیل معنایی، تولید متن و اتصال این قابلیتها به محصولات قرار دارد.
در مسیر جاری، مدلهای زبانی بومی و کاربردمحور بیشتری بر مبنای همین زیرساخت توسعه خواهند یافت. هدف این است که هر مدل بتواند برای مسئلهای مشخص، روی پیکره فارسی مرتبط آموزش ببیند و نقش واقعی گراف در آن بهصورت تفکیکشده ارزیابی شود.
در ادامه، مجموعهدادههای فارسی گستردهتر، معیارهای سنجش تخصصی، گزارشهای قابلتکرار و مقایسه مدلهای گرافمحور و بدون گراف توسعه خواهند یافت. فراهمشدن زیرساخت محاسباتی بیشتر نیز امکان ساخت مدلهای بزرگتر، متنوعتر و کاربردیتر را فراهم خواهد کرد.
در چشمانداز بلندمدت، آزمایشگاه هوش مصنوعی هامان سکویی خواهد بود که مدلهای زبانی ایرانی مبتنی بر معماری ایرانی در آن منتشر میشوند؛ سکویی که هم توان ساخت مدل مستقل فارسی را افزایش میدهد و هم از طریق استانداردهایی مانند MCP، زمینه و شواهد فارسی را در اختیار مدلهای بزرگ دیگر قرار میدهد.
پشتوانه پروژه؛ آریا هامان مهر پارسه
آزمایشگاه هوش مصنوعی هامان و پروژه RGN بخشی از مسیر بلندمدت شرکت دانشبنیان نرمافزاری آریا هامان مهر پارسه برای ساخت فناوریهای فارسیمحور، زیرساختهای هوش مصنوعی و ابزارهای دانشی قابلتوسعه هستند.
محصول «کتابخانه خدمات پردازش زبان طبیعی مبتنی بر گراف» بر پایه RGN تأییدیه دانشبنیان دریافت کرده است. توسعه، پژوهش و سرمایهگذاری این پروژه توسط بخش خصوصی انجام شده و تیم RakhshAI در شرکت آریا هامان مهر پارسه مسئول ایجاد و نگهداری زیرساخت آن است.
برای ما، بومیبودن به معنای جداشدن از جهان نیست. بومیبودن یعنی آغاز از زبان، فرهنگ و داده ایران و در عین حال، حفظ امکان تعامل با استانداردها، ابزارها و جامعه جهانی هوش مصنوعی.
هدف نهایی ما تنها ساخت یک فناوری یا عرضه یک مدل نیست. ما میخواهیم هوش مصنوعی در خدمت صلح، دوستی، گفتوگو و دسترسی آزادتر به دانش قرار گیرد و توان بیانی، معنایی و دانشی زبان فارسی در عصر هوش مصنوعی آشکارتر شود.
سخن پایانی
آزمایشگاه هوش مصنوعی هامان تلاشی برای ساخت یک زیستبوم پایدار پیرامون زبان فارسی است؛ زیستبومی که از داده آغاز میشود، رابطههای زبان را به گراف تبدیل میکند، مدلهای بومی را آموزش میدهد و آنها را از طریق ابزارهای باز و استاندارد در اختیار پژوهشگران، توسعهدهندگان و سازندگان محصول قرار میدهد.
RGN پایه فنی این مسیر است و مدل Haman Persian Article Graph-LLM 125M نخستین خروجی شاخص آن. انتشار عمومی کد، داده، وزنها، مستندات و گردشکار آموزش، نقطه آغاز مسیری است که در آن جامعه فارسیزبان میتواند نهفقط مصرفکننده مدلهای هوش مصنوعی، بلکه سازنده معماریها، زیرساختها و مدلهای زبانی آینده باشد.
ما در آزمایشگاه هوش مصنوعی هامان، آیندهای را دنبال میکنیم که در آن زبان فارسی در حاشیه هوش مصنوعی جهانی قرار نگیرد؛ بلکه با زیرساخت، داده، معماری و مدلهای خود، حضوری فعال و اثرگذار در شکلدادن به این آینده داشته باشد.