00
ENLAZANDO ENLACE ISR CARGANDO RUNTIME YOLO11 CALIBRANDO LUT TÉRMICA HUD EN LÍNEA

Inteligencia Táctica en el Borde

30 FPS END-TO-END · RTX 4060 LAPTOP · ON-PREMISE

Inferencia YOLO11 optimizada para baja latencia, tracking persistente con ByteTrack y procesamiento visual en el borde para flotas UAV comerciales y de defensa.

YOLO11 TENSORRT MEDIAMTX
SYSTEM DRN-ISR-01
STATUS
DEMO SYSTEM
STACK YOLO11 / TRT FP16
INGEST RTMP → MediaMTX
PERF 30 FPS END-TO-END
VERIFICATION BENCHMARK VERIFIED
Arquitectura

Sistemas de Misión

ACTIVE CHANNEL

01 · COMPUTER VISION

Inferencia mediante YOLO11 optimizada por TensorRT FP16 (270+ FPS aislados). Procesamiento a 30 FPS sostenidos con ByteTrack y Kalman.

STATUS · VALIDATED

02 · TELEMETRÍA Y HUD

Procesamiento de video (RTMP/WebRTC) con simulación termográfica realista, LUTs calibradas y telemetría de coordenadas.

STATUS · SIMULATED

03 · TARGET LOCK SYSTEM

Ventana ISR secundaria con zoom óptico suavizado y vector predictivo dedicado al seguimiento autónomo del objetivo bloqueado.

STATUS · PROTOTYPE
┌─ CHANNEL 01 ────────────────────────────┐
│ CAM → RTMP → YOLO11+TRT → ByteTrack → IDs
│ 30 FPS END-TO-END · FP16
└─────────────────────────────────────────┘
ENGINEERING LOG · EDGE COMPUTING

Desafíos de Ingeniería: Optimizando para el Edge

El sistema no fue desarrollado inicialmente sobre un clúster de servidores, sino en una RTX 4060 Laptop: una GPU móvil con límites reales de potencia, temperatura y memoria compartida con el resto del pipeline. Esta restricción convirtió el rendimiento en una decisión de arquitectura, no únicamente en una cifra de benchmark.

01 — El cuello de botella

El desafío apareció al ejecutar simultáneamente la ingesta mediante MediaMTX, la decodificación del stream, la inferencia de YOLO11, el seguimiento persistente con ByteTrack, el filtro predictivo de Kalman y la composición visual del HUD. El problema no era solamente la velocidad del modelo; las transferencias de memoria y la competencia entre etapas podían acumular retraso y romper el procesamiento en tiempo real.

02 — La intervención

El modelo fue preparado para TensorRT con precisión FP16, reduciendo el coste computacional y el consumo de VRAM frente a una ejecución sin optimizar. El pipeline se reorganizó para mantener las etapas sincronizadas con la velocidad real de la fuente, evitando procesar cuadros inútiles o permitir que se acumularan en memoria.

03 — El resultado

El sistema consiguió mantener 30 FPS de extremo a extremo en una RTX 4060 Laptop mientras ejecutaba ingesta, inferencia, tracking y composición visual. Esa cifra no representa únicamente la velocidad aislada de YOLO11 (270+ FPS en benchmark aislado): representa la capacidad del pipeline completo para seguir el ritmo de una fuente de video de 30 FPS sin acumular cuadros pendientes.

Hardware de pruebaRTX 4060 Laptop GPU
PrecisiónFP16
Pipeline completo30 FPS END-TO-END
IngestaRTMP/RTSP vía MediaMTX
InferenciaYOLO11 + TensorRT
TrackingByteTrack + Kalman
DespliegueEdge / On-Premise
Benchmark aislado270+ inf/s (solo TRT FP16)
CAM / STREAM
      ↓
MEDIAMTX INGEST
      ↓
DECODE + FRAME BUFFER
      ↓
YOLO11 · TENSORRT FP16
      ↓
BYTETRACK + KALMAN
      ↓
THERMAL LUT + HUD
      ↓
30 FPS END-TO-END

Valor Empresarial

Optimizar primero para hardware portátil obliga a controlar el consumo de recursos, la latencia y el flujo de datos desde el diseño. Para una organización, esto abre la posibilidad de procesar video localmente, reducir la dependencia de conectividad constante y adaptar la infraestructura a las necesidades reales de cada operación.

Génesis del Proyecto

Los Inicios

Todo comenzó como un experimento para llevar la inferencia de visión artificial al borde (edge computing). El objetivo inicial era capturar el feed de video directo de un dron y procesarlo localmente sin una latencia inaceptable. En esta etapa temprana, establecí la arquitectura base: ingesta de video crudo, primeros pipelines de inferencia ligera y transmisión básica en la red local. Este fue el cimiento técnico que me permitió más tarde incorporar modelos pesados.

FEED · INICIO REC ●
FPS: 30 RAW INGEST
Evolución

HUD Termal & Pruebas en Web

Así es como funciona el sistema en su estado maduro: El feed de vuelo es interceptado por un servidor MediaMTX que distribuye el flujo hacia el pipeline de inferencia principal. Aquí, YOLO11 (acelerado por TensorRT para máximo rendimiento) detecta objetivos en milisegundos, mientras que ByteTrack mantiene la persistencia de identidad de cada objetivo a través de los cuadros (incluso si se ocultan temporalmente). Finalmente, aplico un post-procesado agresivo que simula visión térmica táctica mediante LUTs calibradas, añadiendo telemetría simulada y enviando el resultado final al navegador web.

FEED · PRUEBA-4-WEB LIVE
TARGET LOCK: ENGAGED YOLO11 + TRACKING
Simulación de Hardware

Filtros Crudos

FEED · WHITE HOT SIMULATED
LUT: IRON / W-HOT CONTRAST: HI

Simulación de cámara térmica "White Hot" (Calor). Extrae el contraste puro a través de LUTs aplicadas en tiempo real.

FEED · NIGHT VISION SIMULATED
LUT: GREEN PHOSPHOR EDGE ENHANCE

Simulación de "Visión Oscura". Filtro táctico para visibilidad comprometida que realza los contornos sin destruir el contraste de los negros.

Escenario Avanzado

Integración Completa

El resultado final es un sistema táctico de alto nivel. En esta demostración se expone un escenario de mayor complejidad, validando la integración total y simultánea de los sistemas de visión artificial, seguimiento predictivo, interfaz de usuario (HUD) y filtros térmicos.

[ R&D / EXPERIMENTAL ]

Siguiente Fase: Inteligencia de Enjambre (Swarm AI)

El concepto

El siguiente salto arquitectónico para este sistema es escalar de la inferencia en una sola unidad a la orquestación de múltiples drones operando de forma coordinada. En lugar de pilotaje manual tradicional, el sistema permitiría emitir comandos tácticos de alto nivel a toda la flota (ej. "Fijar y rastrear objetivo a través de múltiples ángulos"), delegando la sincronización al motor de Inteligencia Artificial.

El cuello de botella (Hardware & Red)

Actualmente, este concepto se encuentra en fase de diseño experimental. Ejecutar tracking persistente sobre múltiples fuentes de video simultáneas exige un salto brutal en la infraestructura. Requiere hardware de inferencia de grado servidor (Data Center GPUs) para no saturar el pipeline, y un ancho de banda masivo en frecuencias de radio dedicadas para soportar la transmisión de múltiples streams RTSP/WebRTC sin pérdida de paquetes o latencia crítica.

Spec Sheet

01 · INGEST
RTMP / RTSP
MediaMTX Server
H.264 / H.265 Decoding
[ ONLINE ]
02 · INFERENCE
YOLO11
TensorRT FP16
CUDA Acceleration
[ VALIDATED ]
03 · TRACKING
ByteTrack
Kalman Filter
Persistent IDs
[ PROTOTYPE ]
04 · VISUAL
LUT Simulation (Iron/WH/BH)
Dead Pixel Noise
Edge Enhancement
[ SIMULATED ]
05 · DISTRIB
WebRTC / HLS
Low Latency Sync
Browser Frontend
[ ONLINE ]
Licenciamiento & Integración

Solicitar Auditoría de Flota

El motor de inferencia táctica está disponible para licenciamiento On-Premise. Complete este formulario para que un especialista evalúe sus requerimientos técnicos.

CONTACTO DIRECTO
jarmando2050@outlook.com
// CLASIFICACIÓN: CONCEPTUAL BLUEPRINT

Manifiesto Arquitectónico: Swarm AI

Este proyecto de HUD e inferencia visual es el primer bloque fundamental de una visión mucho más grande. Sin embargo, para escalar de un solo dron a un enjambre táctico autónomo, la realidad de la industria nos enfrenta a límites de hardware y software que la Inteligencia Artificial actual apenas comienza a comprender.

No existe aún un framework "plug-and-play" para este nivel de orquestación. Para llevar esta idea a producción, la arquitectura debe resolver tres cuellos de botella críticos:

01. Lógica de Enjambre y Latencia de Red

Transmitir video crudo desde 20 drones a una estación central satura cualquier red de radiofrecuencia estándar. La solución real exige Edge Computing Distribuido: cada dron debe procesar su propia inferencia localmente y solo transmitir "vectores de estado" (coordenadas, identificadores) mediante una red Mesh descentralizada.

02. Razonamiento Espacial Conjunto

Los modelos de visión actuales detectan objetos, pero carecen de razonamiento predictivo. Si el Dron A pierde de vista a un objetivo detrás de un edificio, el sistema central debe predecir su trayectoria matemática y reasignar al Dron B (en otro ángulo) para interceptarlo automáticamente. Esto requiere IA espacial compleja acoplada a telemetría topográfica.

03. Fusión de Sensores Masiva

La cámara óptica por sí sola no sirve en operaciones complejas. Un sistema robusto requiere integrar LiDAR y cámaras termográficas (SWIR/LWIR) nativas. El software debe amalgamar estas fuentes en un modelo 3D del entorno en tiempo real, multiplicando el consumo computacional y requiriendo arquitecturas de GPU paralelas.

En resumen: La interfaz táctica está diseñada. El motor de inferencia visual es funcional. El siguiente gran paso es una labor de ingeniería profunda en infraestructura de red, algoritmos de predicción espacial y presupuesto de hardware para laboratorios de I+D.