Cómo Claude juzga realmente tu idea de startup (un dump de la cadena de razonamiento)
Una cadena de razonamiento de auditoría es la secuencia de prompts, llamadas a herramientas y veredictos intermedios que un LLM recorre antes de producir su score final — visible para cualquiera que instrumente su servidor MCP e inspeccione la traza.
Claude juzga una idea de startup extrayendo campos estructurados de tu prompt, corriendo tres lentes paralelas de investigación (mercado, competencia, problem-solution), luego un pipeline secuencial (equipo, tracción, modelo de negocio, GTM, finanzas, misión), sacando contradicciones entre lentes y finalmente computando un score ponderado stage-aware en 6 dimensiones. Un `GO` exige score ≥ 80, cero red flags, confianza promedio ≥ 0.6 y ninguna contradicción mayor.
Datos clave
- Pesos de la Metodología v2 cambian por etapa: idea-stage pone 35% en Problem-Solution; Series A+ pone 30% en Tracción.
- Auditoría promedio dispara 8-12 llamadas a herramientas MCP; auditorías complejas con contradicciones disparan 18-22.
- Confianza < 0.6 capa el score máximo en 65 sin importar las puntuaciones de lente.
- Una sola contradicción mayor (severidad ≥ 0.7) automáticamente baja un `GO` a `REFINE`.
Abre el dashboard, click en cualquier auditoría, y lees la traza de razonamiento de arriba a abajo. Aquí está cómo se ve para el ejemplo "audita esta idea: una app de notas con IA para abogados".
Paso 1 — extract
Claude llama extract_idea. Devuelve {stage: "mvp", sector: "legal_tech", problem: "reconstrucción de horas facturables es manual y propensa a error", solution: "voz + captura de pantalla → entrada automática de tiempo"}. La confianza en cada campo se loguea. Ambigüedad ≥ 0.5 detiene el pipeline y pide aclarar — asumir en silencio es como los LLMs genéricos alucinan.
Paso 2 — tres lentes paralelas
Tres skills corren concurrentemente, cada una llamando sus propias herramientas MCP:
audit-market→ llamaweb_searchpara "tamaño mercado legal-tech 2026",dataforseo_trendspara "software horas facturables", devuelve límites de TAM con comparables nombrados.audit-competition→ llamaweb_searchpara "IA horas facturables abogado",lookup_entitypara players nombrados (Clio, MyCase, Smokeball), devuelve 5 segmentos + brechas de mercado.audit-problem-solution-fit→ llamaweb_searchen threads de Reddit en r/Lawyertalk, devuelve 5 titulares de problema con conteo de frecuencia + 5 variantes de solución.
Paso 3 — pipeline secuencial
Cada skill subsecuente consume salidas de las lentes paralelas:
audit-teampesa credibilidad del fundador contra el sector legal-tech.audit-tractionclasifica idea-stage vs establecido contando señales.audit-business-modelgenera 3 variantes (modelo del usuario verbatim + 2 alternativas). Eliges una.audit-gtm-scalemapea evolución en 4 etapas (MVP launch → Y1 piloto → Y2 escala → Y3 crecimiento).audit-financeconstruye proyecciones a 4 años con múltiplos stage-aware.audit-missioncrea slide de Misión investor-ready (titular 80-150 chars, 4 bullets de soporte).
Paso 4 — chequeo de consenso
Toda salida de lente recibe diff por contradicciones. Ejemplo real de una corrida reciente:
Lente A (mercado): "TAM ≈ $4B, CAGR 18%." Lente B (competencia): "Saturada por Clio + 4 incumbents grandes con 80% market share."
Severidad 0.65. Logueada vía herramienta MCP consensus_check. Alimenta dealbreakers.
Paso 5 — dealbreakers v2
Pase final: score ponderado stage-aware, agregación ponderada por confianza, veredicto riesgo-asimétrico. La matemática es:
score = sum(lens_score[i] * stage_weight[i] * confidence[i]) / sum(weight * confidence)
verdict =
GO si score ≥ 80 Y sin red flags Y avg confidence ≥ 0.6 Y sin contradicción mayor
REFINE si 60 ≤ score < 80 O (score ≥ 80 con condición cap-triggering)
KILL si no
Las condiciones cap-triggering son intencionales — score 92 con una contradicción severidad-0.8 no es GO. El sistema yerra hacia falsos negativos para que el fundador escuche la mala noticia antes que el inversor.
Por qué esto le gana a veredictos one-shot de LLM
Un LLM genérico al que le preguntas "¿es buena esta idea?" produce una respuesta plausible porque empareja patrones. El veredicto de metodología v2 es reproducible — mismo prompt, mismas fuentes, mismos pesos, mismo score. Eso lo vuelve útil como herramienta, no sólo conversación.
Corre el tuyo:
curl -fsSL https://inite.studio/install.sh | sh
FAQ
Preguntas frecuentes
¿Qué significa realmente 'stage-aware'?
Los pesos de las 6 lentes se redistribuyen según si la idea está en idea / mvp / seed / series_a_plus. Idea-stage exige evidencia rigurosa de Problem-Solution; Series A+ exige tracción. La misma auditoría con etapas diferentes produce veredictos diferentes.¿Cómo detecta Claude contradicciones entre lentes?
Después de que cada lente corre, la herramienta MCP consensus_check hace diff de pares de claims entre lentes (mercado vs competencia, tracción vs finanzas) y flagga pares con señales opuestas para la misma entidad. Cada contradicción entra con severidad 0-1 y alimenta el pase de dealbreakers.¿Puedo ver la traza cruda?
Sí, parcialmente. El dashboard muestra cada llamada, cada veredicto intermedio y cada contradicción — el cuerpo del prompt en sí queda en tu máquina. El servidor MCP sólo ve inputs estructurados, no la conversación.¿Esto es mejor que preguntarle al ChatGPT '¿es buena mi idea?'?
Concretamente sí — los veredictos de LLM genérico no tienen fundamentación (sin SERP, sin Trends, sin Reddit), sin metodología (salida one-shot, sin chequeo de contradicción) y sin awareness de etapa. El veredicto de metodología v2 es reproducible: mismo prompt, mismas fuentes, mismos pesos = mismo score.
