Разбор темы

Извлечение подстрок по шаблону — работа grep с флагом -o (печатать не строку целиком, а только совпавший фрагмент) в режиме расширенных регулярных выражений -E. Ключевая идея — класс символов [...], задающий множество допустимых символов «тела» токена; несколько диапазонов и одиночных символов перечисляются внутри одних скобок подряд. Важный нюанс мультиязычности: латиница и кириллица занимают разные участки таблицы символов, поэтому единого диапазона для обоих алфавитов нет, а в локали POSIX (без UTF-8) кириллические диапазоны и вовсе не работают — grep сравнивает байты, а не символы.

Что проверяется

  1. Хэштеги извлечены
  2. Найдено 2 хэштега

Как это выглядит