Signal Agent
En desarrollo prototypeUn monitor de mercado donde el modelo tiene que escribir una predicción falsable antes de poder ser evaluado — 3 abiertas, 0 resueltas, las primeras vencen en enero de 2027.
Un monitor de mercado que recolecta por calendario en GitHub Actions y después obliga al modelo a responder por lo que dijo: cada juicio queda firmado, cada llamada trae una predicción falsable con su criterio de resolución escrito de antemano, y el registro de aciertos es el producto de verdad.
Tecnología
- IA & agentes
- Automatización
Sector
- Economía & finanzas
Problema
Casi todas las demos de agentes son infalsables. El modelo produce un párrafo seguro de sí mismo, nadie deja escrito qué habría contado como error, y al mes siguiente hay otro párrafo igual de seguro. La pregunta interesante no es si un modelo puede resumir un mercado: es si después se le puede pedir cuentas, y eso obliga a decidir de antemano qué contaría como fallo.
Qué va a ser
Un caso de estudio sobre lo que realmente importa aquí: el esquema. Un juicio registra quién lo hizo (`judged_by`: claude-code, una persona, o una importación) y su veredicto; la confianza se fuerza a NULL cuando el veredicto es «sin cambio», así que nada puede ser confiadamente ambiguo. Una predicción lleva una afirmación binaria, el criterio de resolución escrito antes de conocer el desenlace, y un horizonte que fija la fecha en que vence. Un resultado es correcto, incorrecto, o genuinamente indeterminado — y lo indeterminado queda excluido de la tasa de acierto en vez de redondearse hacia adentro. Al re-juzgar nunca se lee el veredicto anterior, para que la confianza vieja no ancle a la nueva. Un indicador que en diez predicciones resueltas no le gana a una moneda queda marcado para eliminación. La recolección y el informe se corren solos; el juicio se dispara a mano dentro de Claude Code, y no hay ninguna API key de modelo en el código.
Estado: Solo fase 1: 95 observaciones, 6 señales y 3 predicciones abiertas. Todavía no se ha resuelto nada, así que no hay tasa de acierto que mostrar — las primeras predicciones vencen en enero de 2027 y los comandos de evaluación siguen siendo stubs. Repo y demo vienen después.