¿Sirve ChatGPT para tomar decisiones de negocio?
Para explorar opciones y ordenar ideas, sí, y bastante bien. Para una decisión que después vas a tener que defender, se queda corto. La investigación revisada por pares muestra que los modelos suelen estar mal calibrados: suenan muy seguros aunque acierten poco1. Decidir en serio pide algo más que un buen párrafo: evidencia pesada, una confianza atada a esa evidencia, y un registro que quede.
Un chat es un gran punto de partida. Te ayuda a pensar en voz alta, a poner sobre la mesa alternativas que no se te habían ocurrido, a redactar el primer borrador de casi cualquier cosa. El problema llega más tarde, en la reunión, cuando alguien (un cliente, un socio, el directorio) te mira y pregunta «¿por qué esto y no lo otro?». Si la respuesta honesta es «lo dijo el chat», la conversación se acabó. Eso no sostiene una charla con inversores, y tampoco te ayuda con la próxima decisión.
El problema real: cómo suena cuando se equivoca
Aquí está lo interesante. Todos fallamos. Lo peligroso de un modelo es la seguridad con la que falla. Un trabajo de 2024 que midió la confianza que los modelos declaran encontró que se equivocan hacia arriba casi siempre: amontonan sus puntajes cerca del máximo sin que eso tenga mucho que ver con si aciertan1. Estudios posteriores confirmaron esa brecha entre lo seguros que parecen y lo seguros que en realidad están, y notaron que ciertos entrenamientos la ensanchan2. Llevado a tu decisión: el chat puede darte un «estoy segurísimo» que la evidencia no respalda, y suena igual de convincente que cuando tiene razón.
Qué hace bien y qué le falta
| Lo que necesitas | ChatGPT solo | Lo que falta |
|---|---|---|
| Explorar opciones | Bien | — |
| Pesar la evidencia por confiabilidad | No de forma ordenada | Un paso que puntúe cada dato y marque las contradicciones |
| Una confianza honesta | No; tiende a pasarse de seguro1 | Que la certeza dependa de la calidad de la evidencia |
| Que quede registro | No; se pierde en el hilo | Un memo con el razonamiento y su rastro |
| Un historial de aciertos | No | Guardar el resultado real y medir con el tiempo |
La diferencia, en concreto
Que quede claro: Verdika también usa modelos de IA por debajo. Así que esto no va de estar a favor o en contra de la IA; va de qué haces con su respuesta. Un chat te entrega un párrafo persuasivo y ahí termina su trabajo. Verdika toma el mismo problema y lo devuelve ordenado: las opciones con su puntaje, la evidencia pesada, los supuestos y los riesgos por escrito, y una confianza que no esconde lo que no sabe. Y guarda cada decisión con su resultado, de modo que tu tasa de acierto deja de ser una sensación y se vuelve algo que puedes mostrar.
Cuándo usar cada cosa
La regla que usamos nosotros es simple. El chat, para pensar en voz alta, arrancar un borrador o meterte en un tema nuevo. La plataforma de decisión, cuando el resultado importa de verdad, cuando sabes que alguien va a pedirte el porqué, o cuando quieres ir construyendo un historial de decisiones bien tomadas que hable por ti.
Pasa de una opinión a un memo que puedas defender.
El mismo problema, pero con evidencia, con una confianza honesta y con registro.
Analizar mi decisiónReferencias
- Groot y Valdenegro-Toro, «Overconfidence is Key: Verbalized Uncertainty Evaluation in Large Language and Vision-Language Models», TrustNLP 2024 (arXiv 2405.02917): arxiv.org/abs/2405.02917.
- «Mind the Confidence Gap: Overconfidence, Calibration, and Distractor Effects in Large Language Models» (arXiv 2502.11028): arxiv.org/abs/2502.11028.
También te puede servir: Cómo escribir un memo de decisión · Contratar o estirar la caja