نشریه رخشای

رویدادهای هوش مصنوعی ایرانی

آزمایشگاه هوش مصنوعی هامان؛ زیرساختی ایرانی و متن‌باز برای آینده زبان فارسی

18 دقیقه مطالعه

از زبان فارسی به گراف معنا، از گراف معنا به اولین مدل‌های زبانی ایرانی با معماری ایرانی

زبان فارسی برای حضور مؤثر در عصر هوش مصنوعی، به چیزی فراتر از ترجمه رابط‌های کاربری یا افزودن چند مجموعه‌داده فارسی به مدل‌های موجود نیاز دارد. مدل‌های هوش مصنوعی باید بتوانند ساختار واژه‌ها، پیوند میان جمله‌ها، وابستگی‌های نحوی، ارتباط اسناد، زمینه‌های فرهنگی و رابطه میان مفاهیم فارسی را بهتر درک کنند. تحقق این هدف، بدون ایجاد زیرساختی که از ابتدا برای زبان فارسی طراحی شده باشد، دشوار خواهد بود.

ما در آزمایشگاه هوش مصنوعی هامان ـ Haman Labs، با آدرس اینترنتی : www.hamanlabs.ir وابسته به شرکت دانش‌بنیان نرم‌افزاری آریا هامان مهر پارسه، این مسیر را با ساخت یک زیرساخت فارسی‌محور، گراف‌محور و متن‌باز آغاز کرده‌ایم. این زیرساخت، متن خام فارسی را به گرافی زنده از واژه‌ها، جمله‌ها، اسناد، معناها و رابطه‌ها تبدیل می‌کند و سپس از این گراف در آموزش، تحلیل، استنتاج و تولید متن بهره می‌گیرد. هدف ما ایجاد بستری برای انتشار اولین مدل‌های زبانی ایرانی مبتنی بر معماری ایرانی، توسعه ابزارهای تخصصی زبان فارسی و فراهم‌کردن امکان استفاده مدل‌های بزرگ داخلی و بین‌المللی از شواهد زبانی غنی‌تر فارسی است.

آزمایشگاه هوش مصنوعی هامان قرار است سکوی انتشار نسل تازه‌ای از مدل‌های زبانی ایرانی باشد؛ مدل‌هایی که صرفاً پوسته‌ای بر یک مدل آماده خارجی نیستند، بلکه توکن‌ساز، گراف زبانی، موتور آموزش، حافظه، خط تولید داده و سازوکار استنتاج آن‌ها با تمرکز بر ویژگی‌های زبان فارسی توسعه یافته است.

مأموریت ما؛ قدرت‌بخشیدن به زبان فارسی در عصر مدل‌های بزرگ

مأموریت ما فقط ساخت یک نرم‌افزار پردازش متن یا یک مدل تولید محتوا نیست. ما در حال ایجاد زیرساختی هستیم که بتواند به یکی از پایه‌های فنی هوش مصنوعی فارسی تبدیل شود؛ زیرساختی که پژوهشگران، دانشگاه‌ها، توسعه‌دهندگان، شرکت‌ها و تیم‌های محصول بتوانند بر مبنای آن مدل‌ها و خدمات تازه‌ای بسازند.

در این مسیر، سه اصل راهنمای ماست:

نخست، مدل باید رابطه میان عناصر زبان را در کنار توالی کلمات ببیند. متن فارسی فقط مجموعه‌ای از واژه‌های پشت‌سرهم نیست؛ معنا از ارتباط واژه‌ها با یکدیگر، نقش آن‌ها در جمله، شباهت اسناد، موضوع متن و پیوند مفاهیم شکل می‌گیرد.

دوم، زیرساخت باید بومی، قابل‌تکرار و قابل‌توسعه باشد. از نرمال‌سازی متن و توکن‌سازی تا ساخت گراف، آموزش، ارزیابی و استنتاج، اجزای اصلی باید در اختیار جامعه فنی قرار داشته باشند.

سوم، این دانش باید به شکل متن‌باز و جامعه‌محور منتشر شود تا مسیر پژوهش و ساخت محصول برای فعالان هوش مصنوعی فارسی کوتاه‌تر شود. ما می‌خواهیم دانشی که در زبان و فرهنگ ایران ریشه دارد، در عین حفظ هویت خود، با ابزارها و استانداردهای جهانی تعامل کند.

RGN چیست؟

هسته فنی این مسیر، سکوی Rakhshai Graph-based NLP یا RGN است؛ زیرساخت متن‌باز ما برای پردازش زبان طبیعی فارسی، ساخت گراف‌های زبانی و توسعه مدل‌های زبانی گراف‌محور.

ما RGN را به‌عنوان یک سکوی یکپارچه NLP گراف‌محور برای زبان فارسی ایجاد کرده‌ایم. این سکو، مسیر حرکت از داده خام فارسی تا مدل و محصول قابل‌استقرار را در یک مجموعه منسجم از ابزارهای پایتون، رابط خط فرمان، رابط وب و اتصال MCP فراهم می‌کند. در RGN می‌توان داده را آماده کرد، گراف ساخت، مدل‌های عصبی گرافی را آموزش داد، یک مدل زبانی بومی ایجاد کرد، نتایج را ارزیابی کرد و خروجی را در اختیار یک نرم‌افزار، چت‌بات، عامل هوش مصنوعی یا گردش‌کار سازمانی قرار داد.

به زبان ساده، RGN متن فارسی را از حالت یک رشته خطی از کلمات خارج می‌کند و آن را به شبکه‌ای از ارتباط‌ها تبدیل می‌سازد. در این شبکه، واژه‌ها، جمله‌ها، اسناد، موضوع‌ها و مفهوم‌ها می‌توانند به‌صورت گره نمایش داده شوند و رابطه‌هایی مانند هم‌رخدادی، وابستگی نحوی، شباهت معنایی، تعلق واژه به سند و ارتباط موضوع با سند، به شکل یال میان آن‌ها قرار گیرند.

چهار لایه به‌هم‌پیوسته برای ساخت هوش مصنوعی فارسی

معماری محصولی RGN از چهار لایه اصلی تشکیل شده است که می‌توان آن‌ها را جداگانه یا در کنار یکدیگر به کار گرفت.

پردازش فارسی

لایه نخست، مسئول آماده‌سازی زبان فارسی است. این بخش نرمال‌سازی نویسه‌ها، پاک‌سازی متن، توکن‌سازی، تحلیل زبانی و تولید ویژگی‌های قابل‌استفاده در مدل‌ها را انجام می‌دهد. هدف این است که تفاوت نویسه‌های عربی و فارسی، نیم‌فاصله، علائم نگارشی، اعداد، همزه، اضافه و دیگر ویژگی‌های نوشتاری فارسی به‌صورت کنترل‌شده مدیریت شوند.

هوشمندی گرافی

در لایه دوم، متن به انواع گراف‌های زبانی تبدیل می‌شود. گراف هم‌رخدادی واژه‌ها، گراف واژه ـ سند، گراف شباهت اسناد، گراف وابستگی نحوی، گراف معنایی و گراف چندرابطه‌ای از جمله ساختارهایی هستند که می‌توان در این بخش ایجاد کرد.

موتور بومی مدل

لایه rakhshai_graph_nlp.lm موتور سطح پایین و قابل‌استفاده مجدد RGN است. توکن‌ساز، ساخت داده مدل زبانی، رمزگذار گراف، مدل زبانی علّی، حافظه گراف، آموزش، ارزیابی، تولید متن و مدیریت چک‌پوینت‌ها در این بخش قرار دارند.

گردش‌کارهای محصولی

لایه rakhshai_graph_nlp.llm مجموعه‌ای از گردش‌کارهای سطح بالاتر برای ساخت محصولات مشخص است. نخستین گردش‌کار این لایه، llm.article است که فرایند آماده‌سازی داده، ممیزی، آموزش، آزمون‌های تفکیکی و تولید مقاله ساختاریافته فارسی را پوشش می‌دهد. جداسازی این دو لایه باعث می‌شود موتور اصلی Graph-LM برای کاربردهای مختلف قابل‌استفاده باقی بماند و در عین حال، تیم‌های محصول به رابط‌ها و خروجی‌های پایدار و کاربردمحور دسترسی داشته باشند.

RGN از متن خام تا محصول چه مسیری را طی می‌کند؟

در RGN، یک گردش‌کار کامل می‌تواند با دریافت مجموعه‌ای از متون فارسی آغاز شود. متن‌ها ابتدا پاک‌سازی، یکدست و توکن‌سازی می‌شوند. سپس از رابطه‌های موجود در آن‌ها گراف‌های ساده یا چندرابطه‌ای ساخته می‌شود. شبکه‌های عصبی گرافی روی این ساختارها آموزش می‌بینند و بازنمایی حاصل از گراف با بازنمایی توکن‌های مدل زبانی ترکیب می‌شود.

این زیرساخت، علاوه بر آموزش مدل، مسیر ارزیابی، پیش‌بینی، استنتاج، خلاصه‌سازی، طبقه‌بندی، بازیابی حافظه، تولید متن و ذخیره کامل خروجی‌های اجرای مدل را نیز پوشش می‌دهد. نتیجه می‌تواند از طریق API پایتون، رابط خط فرمان، رابط وب یا MCP در اختیار محصول نهایی قرار گیرد.

به این ترتیب، RGN فقط یک کتابخانه ساخت گراف یا یک مدل زبانی منفرد نیست؛ بلکه زنجیره‌ای یکپارچه برای تبدیل داده فارسی به قابلیت هوشمند قابل‌استقرار است.

نگاه تخصصی به معماری RGN

چرا گراف؟

مدل‌های زبانی متعارف، متن را عمدتاً به‌صورت دنباله‌ای از توکن‌ها پردازش می‌کنند. این روش برای یادگیری بسیاری از الگوهای زبانی مؤثر است، اما همه ساختارهای معنایی و ارتباطی متن لزوماً در فاصله خطی توکن‌ها آشکار نمی‌شوند.

در زبان فارسی، ارتباط یک واژه با واژه‌های هم‌رخداد، نقش نحوی آن، حضورش در اسناد مختلف، شباهت موضوعی متن‌ها و پیوند آن با مفهوم‌های دیگر می‌تواند اطلاعات مهمی درباره معنا فراهم کند. گراف این رابطه‌ها را به ساختاری صریح تبدیل می‌کند تا مدل بتواند علاوه بر توالی، شبکه ارتباطی متن را نیز مشاهده کند.

برای نمونه، در رویکرد TextGCN می‌توان واژه‌ها و اسناد را به گره تبدیل کرد، ارتباط واژه‌ها را با PMI و ارتباط واژه و سند را با TF-IDF وزن داد و سپس با استفاده از مدل‌هایی مانند GCN یا GAT اطلاعات را در شبکه منتشر کرد. به این ترتیب، هر متن جدا از مجموعه دیده نمی‌شود؛ بلکه بخشی از یک شبکه بزرگ‌تر از زبان و اسناد است.

مسیر فنی Graph-LM

مسیر اصلی مدل زبانی در RGN به‌صورت زیر طراحی شده است:

متن فارسی ← توکن‌ساز فارسی ← داده مدل زبانی ← گراف چندرابطه‌ای فارسی ← رمزگذار گراف RGN ← همجوشی تطبیقی گراف و متن ← موتور آموزش کم‌داده ← حافظه گراف وابسته به درخواست ← ترنسفورمر علّی ← تولید متن

این معماری می‌تواند در سه حالت قابل‌مقایسه اجرا شود: ترنسفورمر بدون گراف، مدل دارای گراف ساده هم‌رخدادی و مدل چندرابطه‌ای کامل. در هر سه حالت، توکن‌ساز، داده آموزشی، زیان اصلی مدل زبانی، قالب چک‌پوینت و رابط تولید ثابت می‌ماند و فقط اجزای مرتبط با گراف تغییر می‌کنند. این طراحی امکان اجرای آزمون‌های تفکیکی و اندازه‌گیری نقش واقعی گراف را فراهم می‌سازد.

مدل زبانی پایه از معماری decoder-only استفاده می‌کند. در هسته فعلی، مؤلفه‌هایی مانند RoPE، SwiGLU، RMSNorm و KV-cache نیز در مسیر مدل علّی در نظر گرفته شده‌اند. در کنار آن، رمزگذار گرافی اطلاعات ساختاری را پردازش می‌کند و نتیجه از طریق سازوکار همجوشی قابل‌یادگیری وارد بازنمایی نهایی توکن می‌شود.

توکن‌ساز فارسی؛ نقطه آغاز فهم دقیق‌تر زبان

یکی از اجزای پایه RGN، توکن‌ساز فارسی آن است. این توکن‌ساز برای مدیریت ویژگی‌هایی طراحی شده که در بسیاری از پردازشگرهای عمومی می‌توانند موجب پراکندگی یا از بین رفتن اطلاعات شوند.

در این بخش، نویسه‌هایی مانند «ي» و «ك» به شکل فارسی «ی» و «ک» تبدیل می‌شوند. نحوه برخورد با نیم‌فاصله قابل تنظیم است. اعداد فارسی و عربی و جداکننده‌های اعشاری و هزارگان نرمال می‌شوند و علائم نگارشی فارسی و لاتین به‌عنوان توکن‌های مستقل حفظ می‌شوند تا مرز جمله و ساختار نوشتاری از بین نرود. مدیریت همزه و اضافه، جداسازی سبک برخی پیشوندها و پسوندها و اتصال اختیاری فعل‌های مرکب نیز در این مسیر پیش‌بینی شده است.

RGN از حالت‌های word، char_chunk، BPE و Unigram پشتیبانی می‌کند. حالت Unigram، مسیر عملیاتی پیش‌فرض معرفی شده و با استفاده از قطعه‌های زیرواژه‌ای و پوشش نویسه‌ای، برای کاهش واژه‌های خارج از واژگان در متن فارسی طراحی شده است.

گراف چندرابطه‌ای فارسی

در معماری RGN، گراف صرفاً مجموعه‌ای از یال‌های مشابه نیست. هر نوع رابطه می‌تواند کانال مستقل خود را داشته باشد و مدل تفاوت میان رابطه‌های زبانی را بیاموزد.

گراف پیش‌فرض Graph-LM می‌تواند رابطه‌های زیر را در بر گیرد:

هم‌رخدادی، PMI، وابستگی نحوی، اشتراک ریشه یا بن، ارتباط زیرواژه‌ها، ارتباط واژه با سند و ارتباط موضوع با سند.

ساختار گراف می‌تواند شامل یال‌های موازی باشد؛ یعنی دو گره، در صورت داشتن چند نوع رابطه، برای هر رابطه یک یال مستقل دریافت کنند. این ویژگی اجازه می‌دهد مدل فقط از وجود ارتباط مطلع نشود، بلکه نوع و وزن آن را نیز در فرایند یادگیری لحاظ کند.

هسته استدلال گرافی

RGN از رمزگذارهای گرافی GCN، GraphSAGE، GAT و RGCN پشتیبانی می‌کند.

GCN اطلاعات همسایه‌ها را در ساختار گراف تجمیع می‌کند. GraphSAGE برای یادگیری بر اساس همسایگی و تعمیم به ساختارهای بزرگ‌تر مناسب است. GAT با سازوکار توجه، وزن متفاوتی به همسایه‌ها می‌دهد. RGCN نیز برای پردازش مستقیم انواع مختلف رابطه طراحی شده است.

در حالت رابطه‌محور، شناسه رابطه می‌تواند به شکل یک بایاس قابل‌یادگیری، یک embedding یال یا مسیر مستقیم RGCN در مدل مصرف شود. وزن یال نیز در انتقال پیام دخالت دارد؛ بنابراین رابطه‌ای مانند PMI، فاصله هم‌رخدادی یا وزن تنظیم‌شده یک رابطه معنایی می‌تواند تأثیر متفاوتی بر خروجی داشته باشد.

همجوشی تطبیقی گراف و متن

یکی از مؤلفه‌های اصلی معماری RGN، ترکیب تطبیقی بازنمایی متنی و گرافی است. در این سازوکار، میزان استفاده از گراف به‌صورت ثابت و دستی تعیین نمی‌شود. مدل یاد می‌گیرد در هر زمینه چه اندازه به embedding متنی و چه اندازه به embedding حاصل از گراف اعتماد کند.

این همجوشی می‌تواند در سه سطح انجام شود:

در سطح توکن، برای هر موقعیت از دنباله تصمیم‌گیری می‌شود؛ در سطح جمله، قدرت کلی سیگنال گراف در زمینه کنترل می‌شود؛ و در سطح زیرگراف، خلاصه‌ای از گره‌های غیرتوکنی مانند اسناد یا موضوع‌ها در اختیار مدل قرار می‌گیرد.

این طراحی به مدل اجازه می‌دهد هنگام تولید یا تحلیل متن، در بخش‌هایی که رابطه‌های گرافی مفید هستند از آن‌ها بهره بیشتری بگیرد و در موارد دیگر بر بازنمایی زبانی تکیه کند.

آموزش چندوظیفه‌ای و موتور آموزش کم‌داده

آموزش Graph-LM در RGN فقط به پیش‌بینی توکن بعدی محدود نیست. در صورت وجود داده و گراف لازم، سیگنال‌های دیگری مانند پیش‌بینی توکن پوشانده‌شده، پیش‌بینی یال و همسایه، تشخیص نوع رابطه و هم‌ترازی بازنمایی متن، جمله و گراف نیز می‌توانند در فرایند آموزش مشارکت کنند.

برای مجموعه‌داده‌های کوچک‌تر فارسی، Low-Data Training Engine در نظر گرفته شده است. این بخش از افزایش داده متنی در مجموعه آموزش، حذف تصادفی یال یا گره، نمونه‌برداری زیرگراف، زیان سازگاری contrastive، مرتب‌سازی curriculum و توقف زودهنگام بر اساس اعتبارسنجی استفاده می‌کند. داده اعتبارسنجی افزایش داده نمی‌شود و توکن‌ساز نیز پیش از افزودن نمونه‌های تغییریافته روی داده اصلی آموزش ساخته می‌شود تا کنترل نشت اطلاعات حفظ شود.

همچنین امکان اجرای مدل بدون گراف وجود دارد تا پژوهشگر یا تیم توسعه بتواند نتایج مدل پایه و مدل گراف‌محور را با شرایط یکسان مقایسه کند.

حافظه گراف وابسته به درخواست

در زمان تولید، استفاده از کل یک گراف بزرگ می‌تواند باعث ورود اطلاعات نامرتبط و افزایش هزینه محاسباتی شود. RGN برای حل این مسئله از Graph Memory وابسته به درخواست استفاده می‌کند.

در این مسیر، توکن‌ها و مفاهیم موجود در درخواست به گره‌های حافظه متصل می‌شوند. گره‌ها و همسایه‌های مرتبط بر اساس نوع و وزن رابطه امتیاز می‌گیرند و یک زیرگراف محدود برای همان درخواست ساخته می‌شود. سپس فقط این زمینه مرتبط در اختیار Graph-LM قرار می‌گیرد.

تعداد گره‌ها، عمق گسترش، سقف یال‌ها، حداقل امتیاز و وزن رابطه‌ها قابل تنظیم است. همچنین می‌توان گزارشی ساختاریافته از گره‌ها، رابطه‌ها و میزان پوشش حافظه بازیابی‌شده دریافت کرد. این سازوکار هم برای تولید متن و هم برای توضیح‌پذیری و اتصال مدل به عامل‌های هوش مصنوعی اهمیت دارد.


مدل مقاله‌نویسی فارسی اولین از خانواده LLM های هامان

نخستین LLM ایرانی ساخته ش

نخستین خروجی شاخص این زیرساخت، مدل Haman Persian Article Graph-LLM 125M است که در ۲۴ تیر ۱۴۰۵، برابر با ۱۵ ژوئیه ۲۰۲۶، رونمایی شد.

ما مدل هامان را به‌عنوان نخستین مدل زبانی ایرانی توسعه‌یافته با معماری ایرانی معرفی کرده‌ایم. این مدل، یک Transformer از نوع decoder-only را با یک GCN واژگانی در سطح پیکره و سازوکار همجوشی زمینه‌محور گراف و توکن ترکیب می‌کند. وزن‌های مدل از مقداردهی اولیه تصادفی آموزش دیده‌اند و توکن‌ساز، گراف و خط تولید آموزشی آن برای زبان فارسی ساخته شده‌اند.

مدل هامان با دریافت موضوع، نوع مخاطب، لحن و تعداد بخش‌ها، مقاله‌ای ساختاریافته تولید می‌کند. خروجی می‌تواند به‌صورت Markdown برای انتشار یا JSON برای استفاده در نرم‌افزارها و گردش‌کارهای خودکار دریافت شود.

این مدل یک مدل پایه مقاله‌نویسی است و در نسخه فعلی به‌عنوان چت‌بات، سامانه پاسخ‌گویی قطعی یا مرجع تشخیص واقعیت طراحی نشده است. خروجی‌های آن باید پیش از انتشار بازبینی شوند. کیفیت تولید نیز به داده آموزش، تنظیمات تولید، توکن‌ساز، چک‌پوینت، رمزگذار گراف و شیوه همجوشی وابسته است.


خط تولید بومی مقاله

گردش‌کار مقاله‌نویسی هامان از پنج مرحله اصلی تشکیل شده است.

در مرحله article-prepare، داده‌های TXT، JSONL، CSV یا TSV دریافت، نرمال‌سازی و به قالب مناسب آموزش مقاله تبدیل می‌شوند. رکوردهای کوتاه یا نامعتبر جدا می‌شوند و فایل‌های پیکره، آموزش، اعتبارسنجی، داده‌های پذیرفته‌شده، داده‌های ردشده و manifest ساخته می‌شوند.

در article-audit، کیفیت پیکره، پوشش نویسه‌های فارسی، خطر تکرار، پوشش منبع و فراداده و رفتار توکن‌ساز بررسی می‌شود.

مرحله article-train مدل مقاله‌محور را آموزش می‌دهد و علاوه بر وزن‌ها، تنظیمات مدل، توکن‌ساز، گراف، حافظه گراف، تنظیمات تولید و معیارهای آموزش را ذخیره می‌کند.

در article-ablation می‌توان حالت‌های بدون گراف و گراف‌دار، انواع رابطه و دامنه‌های مختلف گراف را مقایسه کرد.

در نهایت، article-generate چک‌پوینت را بارگذاری می‌کند و مقاله فارسی را بر اساس موضوع، مخاطب، لحن و ساختار درخواستی به‌صورت Markdown یا JSON تحویل می‌دهد.

این تفکیک به ما اجازه می‌دهد مدل مقاله‌نویسی یک محصول مشخص باشد، بدون آنکه موتور عمومی Graph-LM به همان کاربرد محدود شود.


دیتاست مقاله‌های فارسی هامان

داده آموزشی منتشرشده برای این مسیر، مجموعه Haman Persian Wikipedia Articles 186K است. این مجموعه شامل ۱۸۶ هزار مقاله فارسی است و مسیر آماده‌سازی داده مدل هامان را قابل‌مشاهده و تکرار می‌کند.

داده‌ها با فیلدهای عنوان و متن دریافت و به JSONL تبدیل می‌شوند. سپس گردش‌کار article-prepare آن‌ها را با قالب wikipedia_prompt پردازش می‌کند و فایل‌های corpus.txt، train.txt، validation.txt، رکوردهای پذیرفته‌شده و ردشده و manifest.json را می‌سازد.

وزن‌های مدل، دیتاست و نوت‌بوک آموزشی قابل‌تکرار به‌صورت عمومی منتشر شده‌اند تا توسعه‌دهندگان بتوانند مدل را اجرا کنند، مسیر آموزش را مطالعه کنند یا گردش‌کار مشابهی را روی پیکره اختصاصی خود بسازند.

مسیر بومی موتور مدل زبانی بدون اتکا به مدل زبانی خارجی ازپیش‌آموزش‌دیده، embedding آماده، distillation یا داده مصنوعی تولیدشده با LLM طراحی شده است.


اتصال RGN به عامل‌ها و مدل‌های بزرگ

MCP؛ پلی میان زیرساخت فارسی و اکوسیستم هوش مصنوعی

Model Context Protocol یا MCP یک لایه اتصال استاندارد پیرامون هسته RGN است. این لایه معماری اصلی را تغییر نمی‌دهد، بلکه قابلیت‌های پردازش فارسی، ساخت گراف، خلاصه‌سازی، حافظه، تولید و توضیح‌پذیری را در اختیار عامل‌ها، محیط‌های توسعه، چت‌بات‌ها و گردش‌کارهای خودکار قرار می‌دهد.

مسیر مفهومی MCP در RGN چنین است:

متن فارسی ← گراف دانش ← استدلال گرافی ← حافظه گراف ← خروجی توضیح‌پذیر

یک عامل هوش مصنوعی می‌تواند متن را برای تحلیل به RGN ارسال کند، کلیدواژه‌ها و مفاهیم را دریافت کند، گراف دانش بسازد، زمینه مرتبط را از حافظه گراف بازیابی کند و سپس شواهد حاصل را برای تولید پاسخ یا انجام مرحله بعدی یک گردش‌کار به کار گیرد.

منابع MCP به مسیرهای از پیش مجاز محدود شده‌اند و دسترسی دلخواه به فایل‌های سامانه در اختیار عامل قرار نمی‌گیرد. منابع مدل، گراف و اجرای آزمایش فقط‌خواندنی هستند. در نسخه نخست، اجرای shell، حذف فایل، نصب بسته، نوشتن دلخواه و آموزش مستقیم مدل از طریق MCP ارائه نشده است. ورودی‌ها نیز از نظر طول متن، تعداد اسناد و اندازه گراف خروجی محدود می‌شوند.


کمک به درک بهتر فارسی در مدل‌های بین‌المللی

چشم‌انداز آزمایشگاه هامان به ساخت مدل‌های داخلی محدود نیست. RGN می‌تواند به‌عنوان لایه‌ای از شواهد، حافظه و زمینه فارسی در کنار مدل‌های بزرگ بین‌المللی نیز قرار گیرد.

در این حالت، مدل بین‌المللی جایگزین نمی‌شود؛ بلکه پیش از پاسخ‌گویی، اطلاعات ساختاریافته‌ای درباره روابط واژگانی، مفاهیم، گره‌های مهم و مسیرهای ارتباطی متن فارسی دریافت می‌کند. هدف ما این است که مدل‌های بزرگ نیز بتوانند هنگام کار با زبان فارسی به زمینه‌ای فراتر از متن خطی دسترسی داشته باشند و کاربران فارسی‌زبان پاسخ‌هایی مرتبط‌تر، مستندتر و قابل‌توضیح‌تر دریافت کنند.


آزمایش تحلیل شعر فارسی

برای نمایش این مسیر، یک آزمایش زنده و قابل‌بازتولید روی تحلیل یک شعر فارسی انجام شد. شعر و پرسش یکسان در دو حالت در اختیار GPT-5.4 قرار گرفت: یک‌بار به‌صورت مستقیم و یک‌بار همراه با شواهد گرافی تولیدشده از طریق RGN MCP.

در معیار خودکار، پاسخ مجهز به MCP چهار نشانه مرتبط را در برابر یک نشانه در حالت مستقیم به کار گرفت؛ یعنی چهار برابر شواهد مرتبط بیشتر. در امتیازدهی دستی نیز امتیاز از ۲۱ به ۲۵ رسید که معادل حدود ۱۹ درصد بهبود گزارش شد. معیارهای امتیازدهی شامل دقت تفسیر، وفاداری به متن، کیفیت ارتباط نمادها، استفاده از شواهد و کیفیت توضیح بود.

این نتیجه مربوط به یک آزمایش تک‌نمونه‌ای است و جای ارزیابی گسترده روی مجموعه‌ای متنوع از شعرها و متون فارسی را نمی‌گیرد. ما این آزمایش را نشانه‌ای از ظرفیت مسیر گراف‌محور می‌دانیم و توسعه ارزیابی‌های جامع، تفکیک‌شده و قابل‌تکرار فارسی را بخشی از برنامه آینده خود قرار داده‌ایم.


ابزارهای توسعه و استقرار

RGN برای گروه‌های مختلف توسعه‌دهندگان چند مسیر دسترسی فراهم می‌کند.

API پایتون برای استفاده مستقیم از توکن‌ساز، سازنده‌های گراف، مدل‌های گرافی، Graph-LM، حافظه، آموزش و وظایف کاربردی در دسترس است.

ابزار خط فرمان rgnn-cli مسیرهای طبقه‌بندی گرافی، ساخت و آموزش مدل زبانی، ارزیابی، تولید متن و گردش‌کار مقاله را پوشش می‌دهد.

رابط وب فارسی و راست‌به‌چپ امکان مشاهده و اجرای بخش‌های اصلی پروژه را بدون نیاز به نوشتن مستقیم کد فراهم می‌کند. در بخش کامل رابط، کاربر می‌تواند از یک پیکره خام آغاز کند، گراف چندرابطه‌ای را مشاهده کند، Graph-LM را آموزش دهد و با استفاده از مدل و حافظه گرافی متن تولید کند.

اتصال MCP نیز قابلیت‌های پروژه را برای عامل‌ها، محیط‌های توسعه، چت‌بات‌ها و سامانه‌های خودکار قابل فراخوانی می‌سازد.

مسیرهای آموزش روی CPU و GPU پشتیبانی می‌شوند. برای مجموعه‌داده‌های بزرگ‌تر نیز امکاناتی مانند ساخت دسته‌ای آمار گراف، cache قابل‌استفاده مجدد، محدودسازی تعداد همسایه‌ها، DataLoader چندپردازه، mixed precision روی CUDA و ادامه آموزش از چک‌پوینت در نظر گرفته شده است.


کاربردهای RGN

RGN یک زیرساخت عمومی برای ساخت محصولات مختلف فارسی است. مدل مقاله‌نویسی هامان تنها نخستین نمونه از تبدیل این معماری به یک محصول مشخص به شمار می‌رود.

از این سکو می‌توان برای طبقه‌بندی خبر، پیام، نظر کاربران و محتوای شبکه‌های اجتماعی استفاده کرد. خلاصه‌سازی استخراجی می‌تواند جمله‌های مهم را با روش‌های مبتنی بر TextRank یا رتبه‌بندی گرافی انتخاب کند. توصیه‌گر محتوا می‌تواند اسناد نزدیک به یک متن یا پرس‌وجو را پیدا کند. گراف‌های معنایی نیز می‌توانند ارتباط میان واژه‌ها و مفاهیم فارسی را آشکار سازند.

استخراج کلیدواژه، مفهوم و موجودیت، تحلیل معنایی، ساخت گراف دانش، بازیابی از حافظه، تولید متن با شواهد، تحلیل شبکه و ساخت embedding گره‌ها از دیگر مسیرهای قابل‌استفاده هستند. اجزایی برای تشخیص نفرت‌پراکنی نیز در مخزن وجود دارد، هرچند استفاده از چنین طبقه‌بندهای حساسی نیازمند داده نماینده، تحلیل خطا و کنترل سوگیری است.

این قابلیت‌ها می‌توانند در پژوهش و گردآوری شواهد، دستیارهای برنامه‌نویسی، تحلیل و خلاصه‌سازی اسناد، چت‌بات‌های سازمانی، پشتیبانی مشتریان و خودکارسازی گردش‌کارها مورد استفاده قرار گیرند.


متن‌باز، قابل‌تکرار و آماده مشارکت

کد منبع RGN تحت مجوز MIT منتشر شده است. معماری، رابط پایتون، ابزار خط فرمان، رابط وب، مستندات، تست‌ها و مسیرهای ساخت مدل در مخزن پروژه در دسترس جامعه قرار دارند.

وزن‌های مدل هامان در مخزن مستقل مدل نگهداری می‌شوند و از Haman Model License 1.0 استفاده می‌کنند. دیتاست مقاله‌های فارسی هامان نیز با مجوز CC BY-SA 4.0 منتشر شده است. این تفکیک اجازه می‌دهد کد، وزن‌های نسخه‌بندی‌شده و داده آموزشی هرکدام با ساختار مناسب خود نگهداری و توزیع شوند.

پروژه همراه با تست‌های واحد، یکپارچه، CLI، چک‌پوینت، گراف و آزمون‌های end-to-end منتشر می‌شود. مجموعه‌داده‌های کوچک نیز برای بررسی محلی پیاده‌سازی و اجرای تکرارپذیر در مخزن قرار گرفته‌اند. گزارش معیارها، تنظیمات مدل، توکن‌ساز، گراف، حافظه و وضعیت آموزش در خروجی‌های چک‌پوینت ذخیره می‌شوند تا مسیر آزمایش تا حد امکان قابل‌بررسی باقی بماند.


افق توسعه آزمایشگاه هوش مصنوعی هامان

RGN برای ما نقطه پایان نیست؛ پایه‌ای برای توسعه نسل تازه‌ای از هوش مصنوعی فارسی است.

در مرحله کنونی، تمرکز بر نرمال‌سازی و توکن‌سازی فارسی، گراف‌های چندرابطه‌ای، مدل‌های عصبی گرافی، طبقه‌بندی، خلاصه‌سازی، تحلیل معنایی، تولید متن و اتصال این قابلیت‌ها به محصولات قرار دارد.

در مسیر جاری، مدل‌های زبانی بومی و کاربردمحور بیشتری بر مبنای همین زیرساخت توسعه خواهند یافت. هدف این است که هر مدل بتواند برای مسئله‌ای مشخص، روی پیکره فارسی مرتبط آموزش ببیند و نقش واقعی گراف در آن به‌صورت تفکیک‌شده ارزیابی شود.

در ادامه، مجموعه‌داده‌های فارسی گسترده‌تر، معیارهای سنجش تخصصی، گزارش‌های قابل‌تکرار و مقایسه مدل‌های گراف‌محور و بدون گراف توسعه خواهند یافت. فراهم‌شدن زیرساخت محاسباتی بیشتر نیز امکان ساخت مدل‌های بزرگ‌تر، متنوع‌تر و کاربردی‌تر را فراهم خواهد کرد.

در چشم‌انداز بلندمدت، آزمایشگاه هوش مصنوعی هامان سکویی خواهد بود که مدل‌های زبانی ایرانی مبتنی بر معماری ایرانی در آن منتشر می‌شوند؛ سکویی که هم توان ساخت مدل مستقل فارسی را افزایش می‌دهد و هم از طریق استانداردهایی مانند MCP، زمینه و شواهد فارسی را در اختیار مدل‌های بزرگ دیگر قرار می‌دهد.


پشتوانه پروژه؛ آریا هامان مهر پارسه

آزمایشگاه هوش مصنوعی هامان و پروژه RGN بخشی از مسیر بلندمدت شرکت دانش‌بنیان نرم‌افزاری آریا هامان مهر پارسه برای ساخت فناوری‌های فارسی‌محور، زیرساخت‌های هوش مصنوعی و ابزارهای دانشی قابل‌توسعه هستند.

محصول «کتابخانه خدمات پردازش زبان طبیعی مبتنی بر گراف» بر پایه RGN تأییدیه دانش‌بنیان دریافت کرده است. توسعه، پژوهش و سرمایه‌گذاری این پروژه توسط بخش خصوصی انجام شده و تیم RakhshAI در شرکت آریا هامان مهر پارسه مسئول ایجاد و نگهداری زیرساخت آن است.

برای ما، بومی‌بودن به معنای جداشدن از جهان نیست. بومی‌بودن یعنی آغاز از زبان، فرهنگ و داده ایران و در عین حال، حفظ امکان تعامل با استانداردها، ابزارها و جامعه جهانی هوش مصنوعی.

هدف نهایی ما تنها ساخت یک فناوری یا عرضه یک مدل نیست. ما می‌خواهیم هوش مصنوعی در خدمت صلح، دوستی، گفت‌وگو و دسترسی آزادتر به دانش قرار گیرد و توان بیانی، معنایی و دانشی زبان فارسی در عصر هوش مصنوعی آشکارتر شود.


سخن پایانی

آزمایشگاه هوش مصنوعی هامان تلاشی برای ساخت یک زیست‌بوم پایدار پیرامون زبان فارسی است؛ زیست‌بومی که از داده آغاز می‌شود، رابطه‌های زبان را به گراف تبدیل می‌کند، مدل‌های بومی را آموزش می‌دهد و آن‌ها را از طریق ابزارهای باز و استاندارد در اختیار پژوهشگران، توسعه‌دهندگان و سازندگان محصول قرار می‌دهد.

RGN پایه فنی این مسیر است و مدل Haman Persian Article Graph-LLM 125M نخستین خروجی شاخص آن. انتشار عمومی کد، داده، وزن‌ها، مستندات و گردش‌کار آموزش، نقطه آغاز مسیری است که در آن جامعه فارسی‌زبان می‌تواند نه‌فقط مصرف‌کننده مدل‌های هوش مصنوعی، بلکه سازنده معماری‌ها، زیرساخت‌ها و مدل‌های زبانی آینده باشد.

ما در آزمایشگاه هوش مصنوعی هامان، آینده‌ای را دنبال می‌کنیم که در آن زبان فارسی در حاشیه هوش مصنوعی جهانی قرار نگیرد؛ بلکه با زیرساخت، داده، معماری و مدل‌های خود، حضوری فعال و اثرگذار در شکل‌دادن به این آینده داشته باشد.