
Wprowadzenie do problemu / definicja
Cyberprzestępcy stale rozwijają techniki ukrywania treści, które nie zmieniają wyglądu wiadomości dla odbiorcy, ale utrudniają jej analizę przez systemy bezpieczeństwa. Jedną z nowszych metod jest użycie niewidzialnych znaków Unicode do rozbijania słów kluczowych typowych dla kampanii phishingowych. W praktyce oznacza to, że użytkownik widzi pozornie zwykły komunikat, podczas gdy filtr treści może interpretować go inaczej.
To podejście wpisuje się w szerszy trend nadużywania mechanizmów formatowania tekstu i znaków sterujących do obchodzenia zabezpieczeń opartych na prostym dopasowywaniu wzorców, regułach słownikowych i sygnaturach treści.
W skrócie
Badacze Microsoftu opisali kampanię phishingową wykorzystującą technikę określaną jako ASCII smuggling z użyciem niewidzialnych znaków z bloku Unicode Tags. Celem atakujących było osłabienie skuteczności filtrów pocztowych i mechanizmów detekcyjnych bazujących na słowach kluczowych, wyrażeniach regularnych oraz prostych sygnaturach treści.
Kampania osiągała szczyt aktywności na poziomie około 2,37 mln wiadomości dziennie pod koniec lutego 2026 roku. Choć później jej intensywność spadła, aktywność nie wygasła całkowicie. Wiadomości dotyczyły głównie finansowania, pożyczek i kredytów, a część infrastruktury wysyłkowej była powiązana z legalną platformą do e-mail marketingu.
Kontekst / historia
ASCII smuggling było wcześniej kojarzone głównie z atakami na systemy AI, zwłaszcza z próbami ukrywania poleceń przed użytkownikiem przy zachowaniu ich interpretowalności przez system przetwarzający tekst. Opisana kampania pokazuje, że technika ta została skutecznie przeniesiona do środowiska poczty elektronicznej.
Według ustaleń badaczy najbardziej intensywna faza kampanii utrzymywała się przez około trzy miesiące po 9 lutego 2026 roku, a wyraźniejszy spadek aktywności odnotowano po 15 maja 2026 roku. Microsoft powiązał większość wykrywanych wiadomości z klastrem 148 domen nadawczych o tematyce finansowej. Sama kampania nie była całkowicie nowa, ale użycie niewidzialnych separatorów stanowiło istotny etap jej ewolucji.
Analiza techniczna
Rdzeniem techniki jest umieszczenie niewidzialnego znaku Unicode wewnątrz słowa o wysokiej wartości detekcyjnej, na przykład związanego z kredytem, pożyczką lub finansowaniem. Dla człowieka słowo wygląda normalnie, lecz system analizujący treść może traktować je jako odmienny ciąg znaków. W efekcie klasyczne reguły dopasowania przestają działać zgodnie z założeniami.
W analizowanych wiadomościach wykorzystano znaki z bloku Unicode Tags w zakresie U+E0000–U+E007F. Są to specjalne znaki kontrolno-formatujące, które mogą reprezentować odpowiedniki ASCII, a jednocześnie zwykle pozostają niewidoczne podczas standardowego renderowania tekstu. W tym przypadku nie chodziło o zakodowanie całego ukrytego komunikatu, lecz o wstawienie pojedynczego niewidzialnego separatora do wybranych słów.
Technika uderza przede wszystkim w systemy, które analizują treść bez wcześniejszej normalizacji Unicode. Jeśli filtr porównuje ciąg znaków wprost z listą podejrzanych terminów, rozbite słowo może nie zostać rozpoznane. Problem może dotyczyć także narzędzi downstream, w tym systemów DLP, parserów treści, narzędzi threat huntingowych oraz komponentów AI analizujących wiadomości bez oczyszczenia danych wejściowych.
Jednocześnie Microsoft zwrócił uwagę, że mimo skuteczności samego maskowania większość wiadomości nadal była wykrywana innymi metodami, między innymi dzięki analizie reputacji nadawcy, domen, adresów IP oraz dodatkowych sygnałów behawioralnych. Oznacza to, że technika może osłabiać pojedynczą warstwę obrony, ale nie musi prowadzić do pełnego obejścia ochrony wielowarstwowej.
Konsekwencje / ryzyko
Największe ryzyko dotyczy organizacji, które wciąż opierają inspekcję poczty głównie na prostych regułach treściowych bez zaawansowanej normalizacji i korelacji sygnałów. Kampanie wykorzystujące niewidzialne znaki mogą obniżać skuteczność filtrów antyspamowych, reguł SOC, wyszukiwań łowieckich i automatycznej klasyfikacji wiadomości.
Dodatkowym wyzwaniem jest analiza incydentów. Analityk przeglądający treść wiadomości może nie zauważyć niczego podejrzanego, mimo że surowa reprezentacja tekstu zawiera niewidoczne znaki. To zwiększa ryzyko błędnej oceny, opóźnień w triage’u oraz pominięcia istotnych wskaźników kompromitacji.
W szerszym ujęciu kampania pokazuje, że granica między atakami na użytkowników a atakami na warstwę przetwarzania tekstu coraz bardziej się zaciera. Mechanizmy wykorzystywane wcześniej do ukrywania instrukcji przed modelami AI czy systemami moderacji mogą dziś równie skutecznie wspierać omijanie klasycznych zabezpieczeń poczty.
Rekomendacje
Organizacje powinny wdrożyć normalizację i sanityzację Unicode przed zastosowaniem reguł opartych na słowach kluczowych, regexach i sygnaturach. Szczególnie ważne jest usuwanie lub mapowanie znaków z bloku Unicode Tags oraz innych niewidzialnych punktów kodowych, które nie powinny występować w standardowej korespondencji biznesowej.
- dodać etap canonicalization w pipeline’ach analizy poczty,
- traktować obecność znaków tagujących Unicode jako anomalię wysokiej wartości,
- rozszerzyć reguły detekcyjne o inspekcję surowych punktów kodowych,
- korelować analizę treści z reputacją domen, nadawców i infrastruktury wysyłkowej,
- testować filtry na próbkach zawierających niewidzialne separatory i inne formy obfuskacji,
- stosować tę samą normalizację przed przekazaniem treści e-mail do systemów AI i asystentów bezpieczeństwa.
Z perspektywy SOC i zespołów reagowania na incydenty warto również zaktualizować playbooki o analizę nietypowych znaków Unicode w artefaktach tekstowych. W środowiskach o podwyższonym ryzyku uzasadnione może być czasowe blokowanie lub podnoszenie scoringu dla wiadomości zawierających niewidzialne znaki z rzadko używanych zakresów Unicode.
Podsumowanie
Wykorzystanie niewidzialnych znaków Unicode w phishingu to kolejny przykład adaptacji znanych technik obfuskacji do nowych kanałów ataku. Opisana kampania pokazuje, że nawet pojedynczy znak wstawiony do słowa może osłabić skuteczność części zabezpieczeń opartych na analizie treści.
Dla obrońców kluczowe staje się dziś nie tylko wykrywanie słów i wzorców, ale również właściwe przygotowanie danych wejściowych. Normalizacja Unicode, wykrywanie anomalii i korelacja wielu niezależnych sygnałów bezpieczeństwa powinny stać się standardem w nowoczesnej ochronie poczty elektronicznej.
Źródła
- Attackers conceal phishing lures using invisible Unicode characters — https://www.bleepingcomputer.com/news/security/attackers-conceal-phishing-lures-using-invisible-unicode-characters/
- ASCII smuggling crosses over from AI prompt injection to phishing evasion — https://www.microsoft.com/en-us/security/blog/2026/09/03/ascii-smuggling-crosses-over-from-ai-prompt-injection-to-phishing-evasion/
- Unicode Standard, Chapter 23 — https://www.unicode.org/versions/Unicode17.0.0/core-spec/chapter-23/
- FAQ – Language Tagging — https://www.unicode.org/faq/languagetagging.html