Back to Portfolio
UN

Unified Input Sanitization Pipeline

Пять стадий обработки входящих сообщений: - Stage 0: NFKC-нормализация + стрип zero-width/control символов - Stage 1: HTML entity + URL decode - Stage 2: Redact ~60 паттернов инъекций (системные промпты, токенайзер-артефакты, Obliteratus, русские вариации) - Stage 3: Semantic detection (Pliny-style социальная инженерия) - Stage 4: DATA fence с SHA256-границами Trust scoring: channel_reputation x severity-weighted penalties. Порог блокировки 0.3. Для низкодоверенных каналов — accountability marker. Ветка: feat/sanitize-pipeline в форке. 3 коммита, 350+ строк, 200+ тестов. Расширение: MCP-канал (PR #23229) — валидация tool output от LLM-провайдера на prompt injection, те же 5 стадий + MCP-специфичные паттерны.

Key Highlights

  • 5 стадий фильтрации: от normalize до data fence
  • Trust scoring с блокировкой опасных сообщений
  • 60+ паттернов инъекций (RU+EN)
  • 200+ автоматических тестов
  • MCP-расширение: PR #23229 (валидация tool output)

Technologies Used

PythonSecurityRegexUnicode

Role

Author

Duration

Май 2026

Category

Security