JEV es un modelo de TypeSafe AI que no escribe: le das un texto y una pregunta con sus respuestas posibles, y devuelve una de esas respuestas con una probabilidad. Qué es, quién dice cada cifra y cuánto cuesta está en qué es JEV. Aquí va lo otro: los diez casos de uso del video, uno por uno, con lo que hay detrás de cada uno.
El video lo dice en el bloque 10: casi ninguno de los diez existe como una aplicación que puedas descargar, y en tres alguien ya puso el modelo a funcionar y midió. Este artículo es el cuaderno de esa cuenta: qué proyecto existe, qué medimos nosotros después de grabar, qué es una propuesta y qué otra pieza haría falta. La última columna importa porque JEV no ve ni oye; el autor de jev-drone lo escribió en su README: «it takes JSON, not pixels».
La cuenta afinada queda así: dos casos los construyó y midió alguien (5 y 9), uno lo construyó alguien y además lo medimos nosotros (4), tres los medimos sólo nosotros en la prueba de 120 casos (1, 8 y 10), y cuatro siguen siendo ideas sin nadie detrás (2, 3, 6 y 7).
Nivel 1: un día cualquiera
1 · El semáforo del supermercado. Le das la vuelta al envase y la lista de ingredientes es un laberinto. La decisión: verde, amarillo o rojo. JEV no lee la foto; una pieza de reconocimiento de texto le pasa la etiqueta como texto y él elige el color.
Estado: medido por nosotros. 16 de 16 en español y en inglés, con un caso reetiquetado después de ver el resultado: la mermelada «fresa 50 %, azúcar, pectina», que el modelo puso en rojo y nosotros habíamos marcado amarillo. Media mermelada es azúcar. Dudó en 2 de 4 ambiguos. Y si la etiqueta trae los gramos de azúcar no hace falta ningún modelo; se comparan con un umbral.
2 · El moderador de un directo. Miles de mensajes por segundo y filtros de palabras que no ven «h0l4». ¿Pasa o se descarta? El texto ya es texto.
Estado: idea aplicable. No encontramos ningún proyecto publicado y no lo medimos. Lo único con dueño es el precio, 0,042 USD por millón de tokens de entrada y salida gratis, leído en la página de modelos de TypeSafe el 21 de septiembre; cualquier «centavos por hora» es aritmética sobre ese precio. Y hay un techo publicado que un directo grande tocaría: 1.200 peticiones por minuto.
3 · La fatiga al volante. Cierras los ojos dos segundos a 120 km/h. Haría falta una pieza que mire los ojos y un modelo que conteste dentro del auto.
Estado: idea, y hoy no se sostiene. JEV vive en internet, y la ida y vuelta desde una Mac en Ecuador tuvo una mediana de 0,57 a 0,68 segundos: a 33 metros por segundo, son entre 19 y 23 metros antes de la respuesta. Una de cada diez llamadas se colgó 30 o 45 segundos. Un modelo así corriendo dentro del aparato no está publicado.
Nivel 2: máquinas que reaccionan solas
4 · La cámara sin falsas alarmas. Son las tres de la mañana y era una polilla. ¿Merece despertarte? La cámara y su detector describen en texto lo que pasó; JEV contesta sí o no.
Estado: construido y medido por alguien. El autor de HA-Jev conectó JEV a la automatización de su casa en HA-Jev y le pregunta, por ejemplo, si la ropa lleva demasiado en la lavadora; su documentación responde 0,86, un ejemplo y no una tasa de acierto. Dejó dos advertencias literales: «Slower from Europe than the published 70 to 500 ms» y «Not for safety decisions». Nosotros le corrimos la misma pregunta: 16 de 16 en los dos idiomas y dudó en 3 de 4 ambiguos.
5 · Los reflejos de una máquina que se mueve. La aspiradora llega al primer escalón: seguir, rodear, subir o frenar. Los sensores describen el obstáculo, JEV elige la maniobra y el código decide si cabe.
Estado: construido y medido por alguien. Roman Slack publicó jev-drone, un dron simulado en un circuito con obstáculos: 77,5 metros en unos 47 segundos, el objetivo a la vista el 82 % del tiempo y 0,11 segundos de mediana por decisión (80 llamadas). Una regla simple sin modelo se quedaba parada a 17,7 metros. Su README avisa: simulación, «a single 65 s run, not a seed-matched average» y en arenas simples «no advantage». Lo que vale para todo el video es cómo lo armó: un reflejo de seguridad en código, cincuenta veces por segundo, tiene el veto sobre lo que el modelo propone.
6 · Enemigos en videojuegos. A 60 cuadros por segundo cada cuadro dura 16,7 milisegundos y una respuesta que viaja por internet no entra ahí; la decisión iría aparte, unas pocas veces por segundo. La pieza que mira es el propio juego, que ya sabe dónde estás.
Estado: idea aplicable. Lo más cercano publicado es HEIST//ONE, guardias de un juego de sigilo: 288 juicios en una sola corrida, mediana de 259,9 milisegundos, y sus autores dicen que no es un benchmark. Lo leímos resumido, sin contrastar el README: vecino, no ancla.
Nivel 3: donde equivocarse cuesta caro
7 · El juez de línea de barrio. La pelota pica cerca de la línea y tienes una sola cámara. Tres respuestas: adentro, afuera, y «que lo mire una persona».
Estado: idea aplicable. Hace falta una pieza que vea el bote y lo describa respecto a la línea, y ésa es la parte difícil; JEV sólo recibiría la descripción. La herramienta de sí o no, la que el video presenta como «0,5 significa que no lo sabe», la documentación la describe con más modestia: cerca de 0,5 el modelo da al sí y al no una probabilidad parecida. No la probamos; en los 120 casos usamos siempre la de elegir. La tercera respuesta la pone uno, con un umbral fijado con datos propios; TypeSafe no promete calibración.
8 · El escudo contra estafas. Un número desconocido, un familiar con una emergencia, un enlace para pagar. ¿Estafa o legítimo? El mensaje ya es texto.
Estado: medido por nosotros. 16 de 16 en los dos idiomas: «se me cayó el teléfono al agua… transfiéreme 300 urgente» salió estafa con 1,00 y «Ma, ya llegué a casa de la abuela», legítimo. La costura: «Hola tía, soy Camila, cambié de número. Guárdalo porfa» salió legítimo con 0,93, y así empieza la estafa del familiar. La pega del video se mantiene: JEV acepta texto y vive en un servidor, así que el mensaje sale de tu teléfono, y no leímos la página legal de TypeSafe.
9 · El freno de mano en el trabajo. Viernes, quince pestañas, y confirmas borrar un lote de registros por reflejo. ¿Esta acción pasa, se pregunta o se bloquea?
Estado: construido y medido por alguien. jev-guard se pone delante de cada acción de un agente y la mide antes de dejarla pasar: unos 580 milisegundos de mediana en 21 llamadas por la pasarela de Vercel, 0,75 segundos con la API directa desde Taiwán, y unos 0,00004 USD por acción, cuatro céntimos cada mil. Listar archivos pasa; borrar la raíz del disco sale bloqueado. Su letra pequeña: «jev-guard is a guardrail, not a sandbox».
Nivel 4: el árbitro del agente
10 · El agente que da vueltas en círculo. Un agente intenta arreglar un error, falla, prueba una variación casi igual y se queda media hora gastando tu dinero. Mirando los últimos tres pasos: ¿hay progreso o está atrapado?
Estado: medido por nosotros. 16 de 16 en los dos idiomas. Lo interesante es contra qué: una comparación de texto sin modelo, con el umbral fijado antes de escribir los casos, sacó 10 de 16 en español y 11 en inglés, y falló en los bucles que cambian las palabras («déjame revisar tu calendario», «primero necesito mirar tu agenda»). JEV los vio. Su costura: «llamé al restaurante: ocupado» tres veces salió atrapado con 1,00, e insistir esperando es lo que haría una persona. Y lo que hereda: 14 de 120 llamadas en español y 12 en inglés se colgaron entre 30 y 45 segundos, y el fallo estaba en conectar. Un freno que depende de internet tiene los problemas de internet.
Los diez en una tabla
| # | Caso | Estado | Quién lo midió | Cifra | Qué otra pieza hace falta |
|---|---|---|---|---|---|
| 1 | Semáforo del supermercado | medido por nosotros | nosotros, 120 casos | 16/16 es · 16/16 en | lectura de texto en la foto |
| 2 | Moderador de un directo | idea aplicable | nadie | precio: 0,042 USD/M tokens | ninguna, el texto ya es texto |
| 3 | Fatiga al volante | idea, hoy no se sostiene | nosotros, sólo la latencia | 0,57–0,68 s → 19–23 m | ver los ojos + modelo dentro del auto |
| 4 | Cámara sin falsas alarmas | construido y medido por alguien | HA-Jev · nosotros | 0,86 (ejemplo) · 16/16 es y en | cámara que describe lo que vio |
| 5 | Máquina que se mueve | construido y medido por alguien | jev-drone | 77,5 m · 0,11 s por decisión | sensores + código con veto |
| 6 | Enemigos en videojuegos | idea aplicable | nadie (vecino: HEIST//ONE) | 259,9 ms, una corrida, sin contrastar | el propio juego |
| 7 | Juez de línea | idea aplicable | nadie | sin cifra | ver el bote + umbral propio |
| 8 | Escudo contra estafas | medido por nosotros | nosotros, 120 casos | 16/16 es · 16/16 en | ninguna; el mensaje sale del teléfono |
| 9 | Freno de mano | construido y medido por alguien | jev-guard | ~580 ms · 4 céntimos cada mil | ninguna; otras barreras además |
| 10 | Árbitro del agente | medido por nosotros | nosotros, 120 casos | 16/16 · base sin modelo 10/16 | ninguna; red que no se cuelgue |
Las cifras que el video dice y de dónde salen
«Una décima de segundo» es la mediana de jev-drone, 0,11 segundos en 80 llamadas, la prueba más rápida publicada. Las demás salen más lentas: unos 580 milisegundos en jev-guard por pasarela y 0,75 en directo; de 0,643 a 0,674 segundos en classmethod, la prueba independiente, con 40 llamadas; y las nuestras, 680 milisegundos en español y 569 en inglés (661 y 565 sin las colgadas). TypeSafe declara de 70 a 500 milisegundos, y ninguna medición de fuera lo vio.
Dos cifras se retiraron antes de grabar. «80 milisegundos» estuvo en la miniatura y en seis bloques del guion y nadie la había medido; salía de suponer que la inferencia en GPU baja de 100 milisegundos. Y los «cuatro segundos» del chat en el gancho son una impresión de uso: en los 120 casos no le pusimos cronómetro a ningún chat.
«Acierta alrededor de un 68 %» es de classmethod: 67,8 % contra 74,1 % de los modelos con los que lo enfrentó. Nuestro 96 de 96 mide otra cosa, casos cortos y limpios escritos por una sola persona. Y «cuatro céntimos cada mil» es de jev-guard; nuestra cuenta, los tokens que reporta la API por el precio publicado, da 1,7 centavos por mil decisiones, sin comprobar contra una factura.
Cómo saber si tu idea es de este tipo
Tres preguntas, en este orden; sirven aunque el modelo de moda cambie de nombre.
- ¿Puedes escribir las respuestas antes de preguntar? Verde, amarillo o rojo. Estafa o legítimo. Avanza o está atrapado. Si la lista existe, es una decisión; si la respuesta es un párrafo que no puedes anticipar, es otra clase de problema. Y si se calcula, no hace falta ningún modelo.
- ¿Cuánto cuesta equivocarse, y hay alguien después? Un anuncio que se escapa cuesta poco; una cerradura que se abre, no. Los que ya lo montaron lo dijeron: «not for safety decisions», «a guardrail, not a sandbox». Lo dudoso se manda a una persona.
- ¿Tiene que ver u oír algo primero? JEV recibe texto. Si tu idea empieza con una foto, una cámara o un micrófono, otra pieza tiene que mirar y describir, y esa pieza suele ser la parte difícil. Cuatro de los diez casos del video estaban ahí.
La serie sobre JEV en el sitio
Este artículo es el segundo de tres. Qué es JEV explica el modelo, atribuye cada cifra y enseña a encontrar en tu propio código las decisiones que hoy le pides a un modelo que escribe. JEV contra Laya es la prueba entera de 120 casos, con la tabla caso por caso, el CSV y los scripts para repetirla con tus ejemplos. Y todos los videos del canal, con su descripción y sus capítulos, están en la sección de videos.
