Один тактичний пункт збору може перехопити тисячі годин голосового трафіку за тиждень. Майже нічого з цього не має значення. Розвідувальна цінність зосереджена у мізерній частці перехоплень — координаційний дзвінок, позначник підрозділу, вимовлений у відкритому ефірі, кодове слово зі списку спостереження, — похованих в океані рутинного балаканини, тиші та шуму. Обробка COMINT — це інженерна дисципліна, що знаходить сигнал у цьому океані. Це ланцюг програмного забезпечення, який перетворює необроблене демодульоване аудіо на транскрипти, мовні теги та ранжовані сповіщення, щоб обмежений час аналітиків і лінгвістів витрачався лише там, де це окупається. У цій статті розглядається сучасний конвеєр обробки голосу — сегментація, ідентифікація мови, розпізнавання мовлення та виявлення ключових слів — та конструктивні рішення, що визначають, чи працює він на оперативному масштабі.

Конвеєр обробки голосового COMINT

Там, де ELINT займається параметричними сигнатурами радарів та зброярських систем, COMINT займається змістом та метаданими комунікацій. Для голосових перехоплень зокрема, конвеєр обробки є спрямованим графом стадій, кожна з яких звужує дані та додає структуру. Класичні стадії — виявлення голосової активності, діаризація мовця, ідентифікація мови, автоматичне розпізнавання мовлення (ASR) та виявлення ключових слів або вилучення сутностей. Ця дисципліна знаходиться поряд із ширшою проблемою злиття, розглянутою в статті про злиття ELINT та COMINT, оскільки транскрипт набагато цінніший, коли він корелює з контекстом випромінювача та геолокацією перехоплення.

Архітектурний принцип, що регулює кожну стадію, — сортування за прогресивною вартістю. Найдешевші фільтри запускаються першими і відкидають найбільше даних. Виявлення голосової активності коштує майже нічого за секунду аудіо та усуває більшість часу захоплення на типовій мережі. Ідентифікація мови дешевша відносно транскрипції і вирішує, яку дорогу модель викликати. Повний ASR — найдорожча стадія — запускається лише на сегментах, що пройшли через попередні фільтри. Розміщення дорогої стадії перед дешевою є найпоширенішим способом зробити конвеєр COMINT нездатним встигати за збором.

Кондиціювання аудіо та сегментація

Перехоплений голос надходить пошкодженим. HF і VHF тактичні комунікації несуть шум каналу, багатопроменеве поширення, замирання, обрізання від перевантажених передавачів та артефакти кодека від цифрових голосових систем. Перш ніж запускати будь-яку модель, аудіо передискретизується до єдиної частоти — 16 кГц моно є де-факто стандартом для моделей мовлення, — нормалізується підсилення та кондиціюється за допомогою шумозаглушення, відповідного каналу. Агресивне шумозаглушення — це пастка: фільтри, налаштовані на видалення шипіння, також видаляють високочастотну форматну енергію, на яку покладається ASR, тому шумозаглушення має валідуватися щодо похідної частоти помилок у словах, а не на основі того, наскільки чистим звучить аудіо для людини.

Виявлення голосової активності

Виявлення голосової активності (VAD) класифікує кожен короткий кадр аудіо як мовлення або немовлення. На безперервно моніторованому каналі паузи між натисканнями клавіші, хвости замовчувача та мертве повітря домінують у захопленні, і VAD зазвичай відкидає значно більше половини необробленої часової лінії перш ніж щось інше запускається. Нейронний VAD, навчений на зашумленому радіоаудіо, суттєво перевершує простий поріговий фільтр за енергією, який хибно спрацьовує на тонах, сплесках статики та фоновому обладнанні. Вихід VAD визначає межі кожного сегмента, який оброблятиме решта конвеєра.

Діаризація мовця

Діаризація відповідає на питання «хто говорив коли», розподіляючи багатосторонній обмін на сегменти одного мовця. Це важливо з двох причин. По-перше, ідентифікація мови та ASR значно погіршуються при одночасному мовленні, тому ізоляція одного мовця на сегмент покращує кожен наступний результат. По-друге, ідентичність мовця сама по собі є розвідкою — відстеження конкретного мовця по перехопленнях, за голосовими характеристиками, підтримує мережевий аналіз навіть при зміні позивних. Сучасна діаризація використовує кластеризацію ембедингів мовця (x-векторів або ембедингів ECAPA-TDNN) та добре справляється з кількома мовцями на обмін; переповнені мережі з одночасним мовленням залишаються складним випадком.

Ідентифікація мови у масштабі

Ідентифікація мови (LID) — це перемикач маршрутизації конвеєра. Система підтримує фіксований набір цільових мов, кожна з власною моделлю ASR, і LID вирішує, яку з них викликати для кожного сегмента. Помилитися — і сегмент транскрибується моделлю, яка ніколи не бачила цієї мови, виробляючи нісенітницю, що забруднює пошук і марнує обчислення.

Поточна стандартна архітектура відображає кілька секунд аудіо на ембединг фіксованої довжини за допомогою самонаправленого енкодера (мережі у стилі wav2vec 2.0) або x-векторного екстрактора, а потім класифікує цей ембединг за підтримуваним набором мов. На трьох-п'яти секундах чистого, внутрішньосетевого мовлення точність перевищує 95 відсотків. Точність падає на трьох передбачуваних вхідних даних: дуже короткі сегменти, перемикання коду в межах одного висловлювання та близькоспоріднені діалекти або мови, що мають спільну фонологію. Пом'якшення є двостороннім — ніколи не маршрутизуйте результат LID з низькою достовірністю до односпікерної моделі, та тримайте багатомовну модель ASR як резервний шлях для всього, в чому класифікатор не впевнений. Ті самі основи машинного навчання, що керують класифікацією модуляції, застосовуються тут; стаття про класифікацію сигналів за допомогою машинного навчання охоплює проблеми навчальних даних та порогу відношення сигнал/шум, які повторюються у будь-якому розгорнутому класифікаторі.

Ключовий висновок: Найдорожча помилка обробки COMINT — не неправильно розпізнане слово, а неправильно маршрутизований сегмент. Впевнена, але помилкова ідентифікація мови надсилає перехоплення до неправильної моделі ASR, виробляє правдоподібний, але беззмістовний транскрипт, і цей транскрипт потрапляє до доступного для пошуку корпусу аналітика нібито як реальний. Завжди встановлюйте вибір моделі ASR на основі порогу достовірності LID, зберігайте оцінку достовірності та маршрутизуйте все нижче порогу до багатомовного резерву, позначеного для перевірки людиною.

Автоматичне розпізнавання мовлення для перехоплених голосових переговорів

ASR є серцем конвеєра і стадією, де невідповідність домену завдає найбільшої шкоди. Стандартні готові моделі навчаються на чистому, широкосмуговому, розмовному мовленні — подкасти, аудіокниги, записи кол-центрів. Перехоплений військовий голос не є жодним з цих: він обмежений за смугою пропускання, спотворений кодеком, сповнений процедурного жаргону, позивних, вимовлених по буквах сіткових посилань та скорочених кодів, часто вимовляється під тиском.

Наскрізні трансформерні архітектури значною мірою витіснили старіші гібридні системи HMM-DNN для цієї роботи. Моделі encoder-decoder у стилі Whisper та моделі Conformer-CTC краще переносять спотворення каналу і мають сильне багатомовне покриття з одного контрольного пункту, що спрощує роботу з багатьма цільовими мовами одночасно. Для високоцінних, малоресурсних цільових мов виробничий крок — дообробити базову модель на доменному аудіо — записи в смузі пропускання радіоканалу, відповідні артефакти кодека та лексикон військової термінології, назв підрозділів і топонімів. Збільшення навчальних даних із симульованими ефектами каналу (смугова фільтрація, адитивний радіошум, цикли кодека) надійно звужує розрив між еталонною та польовою продуктивністю.

Частота помилок у словах — це ціль для конкретного завдання, а не єдина цифра

Інженери, нові у обробці COMINT, часто запитують про «прийнятну» частоту помилок у словах (WER). Такої немає — вона повністю залежить від того, для чого призначений транскрипт. Для дослівної транскрипції, призначеної для підтримки звітності, WER нижче 15 відсотків є робочою метою, і її можна досягти лише на якісному аудіо рідною мовою. Для сортування — вирішення того, чи заслуговує перехоплення уваги аналітика — WER від 30 до 40 відсотків часто є прийнятним, оскільки рішення про маршрутизацію визначається пригадуванням ключових слів та виявленням сутностей, а не читабельністю. Сильно деградований тактичний голос регулярно виходить за ці цифри, що саме тому конвеєр зберігає решітку розпізнавання і чому обов'язкова перевірка позначених сегментів людиною залишається незмінною.

Решітка розпізнавання важливіша за транскрипт

Поширена помилка — зберігати лише одноостовний транскрипт і відкидати решітку — ранжований граф альтернативних гіпотез, розглянутих декодером. Для COMINT решітка часто цінніша за найкращий шлях. Топонім зі списку спостереження або позначник підрозділу, відкинутий найкращим шляхом, часто виживає як друга або третя за рейтингом альтернатива. Виявлення ключових слів, яке шукає по решітці, відновлює ці терміни; виявлення ключових слів лише по одноостовному транскрипту мовчки їх пропускає. Збереження решітки з мітками часу на рівні слів, вирівняними з аудіо, є свідомою вартістю зберігання, яка виправдовується пригадуванням.

Виявлення ключових слів та вилучення сутностей

Фінальна стадія перетворює транскрипти на ранжовані сповіщення. Паралельно виконуються дві взаємодоповнювальні техніки. Текстове виявлення ключових слів зіставляє транскрипт та решітку з активним списком спостереження — назви місць, позначники підрозділів, типи зброї, кодові слова — та з моделями іменованих сутностей, що вилучають осіб, організації, місця та часи. Оскільки воно шукає по решітці, а не лише по найкращому шляху, воно відновлює терміни, відкинуті транскриптом. Акустичне виявлення ключових слів зіставляє аудіо безпосередньо з шаблонами запитів за прикладом або послідовностями фонем, без необхідності повного транскрипту взагалі. Цей другий шлях робить систему надійною для мов, де ще немає виробничої моделі ASR, та для позасловникових термінів — абсолютно нове кодове слово можна реєструвати акустично в момент, коли аналітик почує його один раз.

Збіги з обох шляхів оцінюються, дедублікуються по перекриваючих дугах решітки та поєднуються з метаданими — мовець, пріоритет збору, частота та пеленг — в єдиний показник релевантності. Черга аналітика представляє ранжовані перехоплення із синхронізованим відтворенням аудіо, транскриптом, затіненням достовірності на невпевнених словах та однокліковим зворотним зв'язком. Ця петля зворотного зв'язку — не розкіш: виправлення аналітика є найякіснішими позначеними даними, які програма коли-небудь отримає, і спрямування їх назад у дообробку моделі та налаштування списку спостереження є тим, що підтримує зростання точності протягом усього терміну розгортання. Там, де обсяг позначеного матеріалу все ще перевантажує лінгвістів, великі мовні моделі можуть попередньо підсумовувати та кластеризувати транскрипти — шаблон, досліджений у статті про LLM для сортування розвідки.

Операційна робота конвеєра у масштабі

Масштабування обробки голосового COMINT — це проблема пропускної здатності з жорстким обмеженням реального часу: конвеєр повинен встигати за збором, або він назавжди відстане. Стандартна архітектура розв'язує стадії через шину повідомлень, щоб кожна могла масштабуватися незалежно — VAD і діаризація на CPU-воркерах, LID і ASR на GPU-воркерах, виявлення ключових слів і вилучення сутностей на окремому рівні. Оскільки ранні фільтри відкидають так багато даних, дорогий GPU-рівень бачить лише частку необробленого аудіо, а розміри GPU-кластера визначаються об'ємом мовлення після VAD, а не необробленою частотою захоплення.

Дві оперативні реалії формують кожне розгортання. По-перше, контроль класифікації та принцип необхідності знання застосовуються до похідних продуктів так само суворо, як і до необробленого перехоплення: транскрипт, мовний тег та збіг ключового слова успадковують застереження щодо обробки вихідного аудіо, а доступ фільтрується на рівні даних. По-друге, багато з цих систем працюють у відключених або обмежених за пропускною здатністю анклавах, що підштовхує до дистильованих, придатних для розгортання на краю мережі моделей, які обмінюють кілька відсоткових пунктів точності на здатність працювати майже в реальному часі на захищеному сервері без дата-центру за ним. Правильний баланс між великою, точною хмарною моделлю та маленькою, швидкою граничною моделлю є рішенням про розгортання, а не фіксованою відповіддю.

Планування пропускної здатності також має враховувати поведінку черги при сплеску. Обсяг збору є вибуховим — période підвищеної активності може помножити частоту голосового трафіку протягом хвилин — і конвеєр, розрахований на середню частоту, накопичить чергу, яку ніколи не зможе очистити після завершення сплеску. Стандартне пом'якшення — еластична GPU-ємність для рівня ASR плюс планувальник із пріоритетним обліком: частоти з високим пріоритетом, позначені мовці та колектори, суміжні зі списком спостереження, скорочують чергу, тоді як рутинна балаканина з низьким пріоритетом обробляється за найкращих зусиль або знижується в пріоритеті. Не менш важливою є спостережуваність — затримка на кожній стадії, глибина черги, розподіл достовірності моделі та частота маршрутизації за мовами мають постійно моніторуватися, оскільки тиха деградація на будь-якій окремій стадії (дрейфуючий поріг VAD, надто агресивний засіб шумозаглушення, модель LID, що втрачає точність на новому діалекті) тихо отруює все нижче по потоку задовго до того, як аналітик помічає, що транскрипти погіршилися.

Нарешті, нічого з цього не виводить людського лінгвіста з процесу; це змінює те, що лінгвіст робить. Замість прослуховування необробленого аудіо в реальному часі, лінгвіст працює з ранжованою чергою попередньо сегментованих, попередньо транскрибованих, попередньо позначених перехоплень, підтверджуючи або виправляючи машинний вихід та додаючи аналітичне судження, якого жодна модель не виробляє. За правильного проектування обробка COMINT не замінює аналітика — вона множить досяжність одного аналітика до обсягу трафіку, який інакше було б неможливо охопити взагалі.

Обробляйте перехоплений голос в оперативному темпі

Corvus SENSE приймає демодульоване аудіо COMINT та виконує виявлення голосової активності, ідентифікацію мови, розпізнавання мовлення та виявлення ключових слів в єдиному придатному для розгортання конвеєрі — створеному для сортування тисяч годин перехоплень до сповіщень, що мають значення.

Дізнатися про Corvus SENSE → Замовити брифінг

Цей аналіз підготовлений інженерами Corvus Intelligence, які створюють критично важливе для місії програмне забезпечення SIGINT та RF-аналітики для оборонних і урядових організацій. Дізнатися про нашу команду →