FanarGuard: A Culturally-Aware Moderation Filter for Arabic Language Models
DGX agentarXiv:2511.18852v2 Announce Type: replace Abstract: Content moderation filters are a critical safeguard against alignment failures in language models. Yet most existing filters focus narrowly on gener