Back to Portfolio
UN
Unified Input Sanitization Pipeline
Пять стадий обработки входящих сообщений: - Stage 0: NFKC-нормализация + стрип zero-width/control символов - Stage 1: HTML entity + URL decode - Stage 2: Redact ~60 паттернов инъекций (системные промпты, токенайзер-артефакты, Obliteratus, русские вариации) - Stage 3: Semantic detection (Pliny-style социальная инженерия) - Stage 4: DATA fence с SHA256-границами Trust scoring: channel_reputation x severity-weighted penalties. Порог блокировки 0.3. Для низкодоверенных каналов — accountability marker. Ветка: feat/sanitize-pipeline в форке. 3 коммита, 350+ строк, 200+ тестов. Расширение: MCP-канал (PR #23229) — валидация tool output от LLM-провайдера на prompt injection, те же 5 стадий + MCP-специфичные паттерны.
Key Highlights
- 5 стадий фильтрации: от normalize до data fence
- Trust scoring с блокировкой опасных сообщений
- 60+ паттернов инъекций (RU+EN)
- 200+ автоматических тестов
- MCP-расширение: PR #23229 (валидация tool output)
Technologies Used
PythonSecurityRegexUnicode