Sí, la IA ya puede buscar en grabaciones de cámaras de seguridad: escribes lo que buscas en lenguaje natural, por ejemplo "persona con sudadera roja junto a la caja" o "camión blanco en el andén de carga", y el sistema devuelve los clips que coinciden con la cámara y la hora, sin que nadie revise horas de video. Este tipo de búsqueda semántica funciona comparando el significado de tus palabras con lo que aparece en el video, no solo filtrando eventos de movimiento. Lo que la IA no hace es sustituir el criterio humano: los resultados son candidatos que una persona verifica, y la calidad sigue dependiendo del ángulo, la resolución y la iluminación de la cámara. Axentra OmniSight ofrece búsqueda en lenguaje natural sobre el video archivado de las cámaras que ya tienes, de cualquier marca, en tus propios servidores, con búsquedas confirmadas en unos 40 segundos.
¿Cómo busca la IA en el video de las cámaras de seguridad?
Algunos sistemas modernos usan modelos de visión y lenguaje. Verkada, por ejemplo, explica que usa una versión de código abierto de un modelo CLIP que convierte tanto el texto de la búsqueda como las imágenes en "embeddings" numéricos; cuando el texto y la imagen se relacionan, los embeddings son muy similares, y así el sistema relaciona una búsqueda con los cuadros de video correspondientes. Sumado a la detección de objetos (personas, vehículos) y a lectores especializados (placas, texto en vehículos), esto permite buscar por descripción en lugar de por hora.
En la práctica, una investigación que antes empezaba con "saca todas las cámaras de 9 p.m. a medianoche" ahora empieza con una frase. La IA reduce miles de horas a unos pocos clips; tu investigador pone el criterio.
¿Qué puede hacer hoy la búsqueda de video con IA y qué no?
Lo que funciona bien
- Búsqueda descriptiva: colores de ropa, objetos que alguien carga, tipo y color de vehículo, una persona en una puerta o pasillo concreto.
- Texto y placas: lectura de placas, números económicos de flotilla y rotulación de vehículos.
- Seguimiento entre cámaras: seguir a una persona o vehículo de cámara en cámara y reconstruir su ruta.
- Reglas en tiempo real: la misma comprensión aplicada al video en vivo ("avísame si alguien entra a la bodega después del cierre").
Lo que todavía no puede hacer
- Garantizar una coincidencia. La búsqueda devuelve candidatos probables; una persona confirma lo que realmente pasó.
- Ver lo que la cámara no captó. Malos ángulos, reflejos, baja resolución o escenas nocturnas sin luz suficiente limitan a cualquier modelo.
- Buscar en una cámara que estaba caída. Si una cámara estaba tapada, girada o fuera de servicio, no hay video que buscar; por eso importa detectar esas fallas a tiempo.
- Decidir por ti. La identificación, sobre todo el reconocimiento facial, requiere revisión humana y debe cumplir con el marco legal federal, estatal y local aplicable y con las políticas de tu empresa.
¿Por qué importa esto para prevención de pérdidas y el SOC?
Con, por ejemplo, 10 cámaras por tienda, una cadena de 1,000 tiendas tendría 10,000 cámaras. Ningún GSOC puede verlas todas en vivo, y cuando se reporta un incidente alguien tiene que encontrarlo después. Incluso los propios fabricantes del sector reconocen que los equipos han pasado horas o incluso días revisando video tras un incidente. La búsqueda en lenguaje natural ataca justo ese cuello de botella: patrones de robo organizado, fraude en devoluciones, accesos fuera de horario, reclamos por caídas o un vehículo visto en varias sucursales.
¿Qué opciones están evaluando los equipos de seguridad?
- Revisión manual y videowalls. Los operadores ven en vivo una fracción de las cámaras y después revisan grabaciones por hora y cámara. Confiable, pero lento y no escala a una cadena.
- Plataformas de IA administradas en la nube. Verkada anunció su búsqueda con IA en lenguaje natural, en beta, en mayo de 2024 y ha añadido reconocimiento facial y mapeo de trayectorias a su analítica. En búsqueda es genuinamente comparable. La diferencia es la arquitectura: Verkada describe una arquitectura de nube híbrida en la que el procesamiento de video ocurre tanto en sus cámaras como en sus centros de datos, y una comparación publicada por Coram, también proveedor competidor, la describe como una plataforma administrada en la nube con hardware estrechamente integrado; las cámaras de terceros pueden conectarse mediante su Command Connector.
- Capas de IA sobre cámaras existentes. La misma comparación de Coram describe a Spot AI como una capa de IA y búsqueda semántica sobre cámaras existentes. En reutilizar tus cámaras actuales, ese enfoque es comparable a OmniSight; la pregunta para cualquier proveedor es dónde viven tu video y el procesamiento de IA.
¿Por qué considerar OmniSight para una empresa multisitio?
OmniSight es una sola capa de IA sobre las cámaras existentes de todas tus tiendas, diseñada para que el video no salga de tu organización:
- Todas las cámaras, 24/7. Analiza todas tus cámaras en tiempo real y alerta a los operadores, en lugar de depender de personas que ven una fracción de las señales.
- Búsqueda y reglas en lenguaje natural. Busca en el video archivado con tus propias palabras (búsquedas confirmadas en unos 40 segundos) y crea reglas en vivo igual, por ejemplo "avísame si ves un accidente".
- Seguimiento entre cámaras. Sigue a personas y vehículos de cámara en cámara y genera su ruta.
- Reconocimiento facial con revisión humana y lectura vehicular. Compara rostros contra listas de interés y cada coincidencia la revisa un operador; lee placas, números económicos y rotulación de vehículos.
- Salud de cámaras en toda la cadena. Detecta automáticamente cámaras tapadas, giradas o fuera de servicio, para que los huecos no aparezcan justo cuando necesitas el video.
- Cualquier marca y tu VMS actual. Un VMS unificado para parques mixtos: cámaras IP vía ONVIF y RTSP, marcas como Hikvision, Dahua, Axis, Hanwha, Uniview, Bosch, Avigilon, Verkada y Cisco, y VMS como Milestone y Genetec. Sin reemplazar lo que ya tienes.
- On-premise. Corre en servidores con GPU en tu centro de datos; el video nunca sale de tu organización y no depende de servicios en la nube. Las alertas y búsquedas quedan registradas.
A la fecha, Axentra ha confirmado más de 1 millón de vehículos detectados y más de 1,000 alertas enviadas a operadores. Axentra también suministra hardware y entrega proyectos llave en mano.
| Criterio | Axentra OmniSight | Revisión manual | Plataforma IA en la nube (ej. Verkada) |
|---|---|---|---|
| Búsqueda de video en lenguaje natural | ✓ ~40 s confirmados | ✗ Revisión por hora | ✓ La ofrece |
| Analiza todas las cámaras 24/7 | ✓ Con alertas | ✗ Una fracción | ✓ Alertas con IA |
| Ruta entre cámaras | ✓ Generada | ✗ Manual | ✓ Mapeo de trayectorias |
| Rostros (con revisión humana), placas, números económicos | ✓ | ✗ Manual | Reconocimiento facial y LPR; números económicos: consultar al proveedor |
| Detección de cámaras tapadas/giradas/caídas | ✓ Automática | ✗ A menudo pasa inadvertido | Alertas de cámara desconectada y de manipulación; vista tapada: consultar al proveedor |
| Cualquier marca + VMS existente | ✓ ONVIF/RTSP, Milestone, Genetec | ✓ | Parcial: cámaras de terceros vía Command Connector |
| Video e IA en tus servidores | ✓ On-premise | ✓ Solo video, sin IA | ✗ Administrada en la nube; procesamiento en cámaras y centros de datos de Verkada |
Conclusión: si necesitas búsqueda con IA sobre un parque de cámaras mixto y multimarca sin enviar video a la nube, OmniSight está diseñado justamente para eso.
¿Cómo probar la búsqueda de video con IA sin un gran proyecto?
OmniSight ofrece un piloto gratuito de 10 días con hasta 10 de tus propias cámaras. Escribe sobre el video de esas cámaras las búsquedas que harían tus investigadores y evalúa tú mismo los resultados. El licenciamiento es por cámara procesada, por año, con licencias flotantes, así que puedes empezar por las sucursales que más importan.