مهران صفایانی
بازیابی دقیق مواد قانونی یكی از چالش های مهم در سامانه های هوشمند حقوقی است؛ زیرا پرسش های كاربران معمولا با زبانی غیررسمی و وابسته به زمینه بیان می شوند، در حالی كه متون قانونی دارای اصطلاحات رسمی و تخصصی هستند. این تفاوت، فاصله واژگانی و مفهومی میان پرسش و قوانین ایجاد می كند و تشخیص قابلیت اعمال یك ماده قانونی نیز نیازمند درك نحوه تفسیر و كاربرد عملی قوانین است. این چالش در زبان فارسی به دلیل محدودیت منابع ساخت یافته و محك های استاندارد ارزیابی، اهمیت بیشتری دارد.
در این پژوهش، چارچوب چندعاملی و گراف محور CLAREX برای بازیابی مواد قانونی فارسی ارائه شده است. این چارچوب شامل عامل گسترش اصطلاحات حقوقی، عامل بازنمایی و بازنویسی پرس وجو، حافظه تجربی مبتنی بر گراف و بازرتبه بندی دوگانه مبتنی بر گراف است كه با تركیب شواهد معنایی، ساختاری و تجربی، مواد قانونی مرتبط را بازیابی و رتبه بندی می كند.
همچنین، برای كاهش هزینه محاسباتی، مدل كوچك Gemma-3-4B-IT با انتقال رفتار مدل Gemma-3-27B-IT برای انجام وظایف عامل ها در بازیابی حقوقی فارسی تطبیق داده شد. علاوه بر این، یك محك ساخت یافته فارسی شامل پرسش های حقوقی مبتنی بر موقعیت های واقعی و پرسش های چندگزینه ای آزمون های حقوقی و وكالت برای ارزیابی كیفیت بازیابی و تأثیر آن بر استدلال حقوقی توسعه یافت.
نتایج نشان داد كه CLAREX در مقایسه با روش های پایه، عملكرد بهتری داشته و به 66/6 در Recall@5 و 48/6 در MAP@5 دست یافته است كه به ترتیب 12/8 و 10 واحد درصد بهبود نسبت به قوی ترین روش پایه نشان می دهد. همچنین، بازیابی پیشنهادی دقت پاسخ گویی آزمون وكالت را از 33/0 در حالت بدون بازیابی و 36/8 در روش بازیابی تقویت شده متداول، به 40 افزایش داده است.
در بخش تطبیق مدل نیز، مدل تخصصی شده Gemma-3-4B-IT موجب افزایش Recall@5 از 52/2 به 61/7 شد و حدود 92/5 از عملكرد مدل 27 میلیارد پارامتری را با تنها 15 از تعداد پارامترهای آن حفظ كرد. این نتایج نشان می دهد كه تركیب بازیابی چندعاملی و گراف محور با مدل زبانی كوچك تخصصی، امكان بهبود بازیابی و استدلال حقوقی فارسی را همراه با كاهش هزینه محاسباتی فراهم می كند.

