Inicio Blog IA & Automatización
IA & Automatización

IA para calificar leads B2B: qué delegar y qué no

Usa un LLM para triar y enriquecer leads B2B antes de que un comercial los lea. Qué puede decidir el modelo, qué no, y cómo dejar rastro.

Lionel Fenestraz · 14 de septiembre de 2026 · 12 min de lectura · Actualizado: septiembre de 2026
Compartir
Manos clasificando formularios impresos en dos montones junto a un portátil
En este artículo

En casi todas las cuentas B2B que audito, el formulario recibe tres cosas por el mismo tubo: el lead de verdad, el candidato que busca trabajo y el proveedor que quiere venderte SEO. Los tres caen en el mismo buzón. Los tres consumen el mismo rato de un comercial que cuesta dinero por hora, y el tercero llega mejor redactado que el primero.

Este post va de la capa de triaje: lo que ocurre entre que alguien pulsa enviar y un humano lee el lead. No va del modelo de puntuación, que ya cubrí aparte. Va de usar un LLM para leer texto libre y limpiar datos, sin que acabe decidiendo a quién se llama.

En 30 segundos:

  • La IA sirve para leer y estructurar el lead, no para puntuarlo. Los pesos del scoring son una decisión de negocio.
  • El modelo produce una puntuación segura de sí misma aunque no sepa nada del lead. Ese es el fallo contra el que hay que diseñar.
  • Un rechazo automático sin revisión humana entra en terreno regulado, no solo en terreno arriesgado.
  • El registro de auditoría (entrada, prompt, salida, decisión humana) es lo que convierte esto en un sistema.
  • Mandas datos personales a un tercero: necesitas base jurídica, minimización y plazo de conservación escrito.

¿Qué hace bien de verdad un LLM con un lead B2B?

Leer texto y convertirlo en campos. Eso es todo, y ya es mucho. Lo caro de calificar un lead B2B no es la aritmética: es que la información llega en prosa desordenada dentro de un campo “cuéntanos tu proyecto” que nadie normaliza.

Hay cinco tareas donde, en mi experiencia, el modelo aporta desde el primer día:

  • Sacar hechos del texto libre. Presupuesto, plazo, herramienta que ya usan, número de sedes. Está en el mensaje y nadie lo extrae: son dos minutos por lead.
  • Clasificar la intención. Petición de precio, petición de información, solicitud de empleo, propuesta comercial entrante, spam. Uso cinco etiquetas, no quince.
  • Detectar la basura evidente. El candidato que pega su CV en comentarios y la agencia que abre con “espero que este mensaje te encuentre bien” se detectan muy bien: el patrón es lingüístico.
  • Normalizar nombres de empresa. “acme”, “Acme S.L.”, “ACME Iberia” y “acme.es” son la misma cuenta. Tu CRM cree que son cuatro.
  • Redactar un resumen de tres líneas para que el comercial sepa de qué va la llamada.

Fíjate en lo que no hay en esa lista: ninguna de las cinco es una decisión. Son transformaciones de texto, y eso se revisa en dos segundos con el mensaje original al lado. Ahí está la clave del diseño. Y si tu CRM guarda tres registros de la misma cuenta, los duplicados inflan tu volumen de leads y hunden la tasa de cierre aparente.

¿Qué no debe decidir nunca el modelo por su cuenta?

Dos cosas: los pesos finales del scoring y cualquier cosa que acabe en un rechazo automático. El resto es negociable.

Empiezo por el fallo, porque explica la regla. Si le pides a un modelo que puntúe un lead del 0 al 100, te devuelve un 78. Con cuarenta palabras de mensaje, sin datos firmográficos y sin saber si esa empresa ya rebotó dos veces, te devuelve un número y un tono perfectamente convencido. La documentación de Anthropic lo dice sin rodeos: “Even the most advanced language models, like Claude, can sometimes generate text that is factually incorrect or inconsistent with the given context”. La misma página cierra recordando que estas técnicas reducen las alucinaciones pero no las eliminan, y que hay que validar la información crítica.

¿Y cuál es aquí la información crítica? La que decide si una persona recibe una llamada o desaparece en una carpeta.

TareaQuién decidePor qué
Extraer presupuesto y plazoModelo, con muestreoTranscripción verificable contra el original
Clasificar intención en 5 etiquetasModeloPatrón lingüístico, bajo coste de error
Marcar como spam o candidaturaModelo propone, humano confirmaUn falso positivo es un lead perdido
Normalizar nombre de empresaModelo propone, humano fusionaToca datos maestros del CRM
Asignar los pesos del scoringHumano, siempreDecisión de negocio, no lectura de texto
Descartar un leadHumano, siempreRechazo automático con efectos sobre la persona

La última fila no es prudencia mía. La Comisión Europea explica que la decisión totalmente automatizada solo se autoriza en tres supuestos, y que hay que garantizar al afectado el “derecho a obtener intervención humana y el derecho a impugnar la decisión”. He visto pipelines que mandan al limbo a quien el modelo puntúe por debajo de 40. Es justo lo que ese texto regula.

Hay una versión intermedia que sí uso: el modelo ordena la cola y no descarta a nadie. Arriba lo caliente, abajo lo frío, y el comercial baja hasta donde le da el día. La diferencia entre ordenar y descartar parece semántica y es justo lo contrario.

¿Cómo se monta esto encima del scoring que ya tienes?

Como una capa previa, nunca como un sustituto. Tu modelo de puntuación define qué criterios importan y con qué peso. Si aún no lo tienes escrito, empieza por ahí: tengo una guía sobre lead scoring B2B sin sobre-ingeniería y no tiene sentido automatizar una decisión que no has tomado.

Lo que hago cuando lo monto para un cliente:

  1. Congela el modelo de scoring en una hoja. Criterios, pesos, umbral de MQL y de SQL. Si no cabe en una hoja, está sobre-ingeniado.
  2. Define el esquema de salida antes que el prompt. Campos exactos y tipos. Es lo que impide que el modelo escriba un ensayo donde esperabas un booleano.
  3. Fuerza esa estructura en la llamada. La documentación de salidas estructuradas de Anthropic reconoce el problema: “Without structured outputs, Claude can generate malformed JSON responses or invalid tool inputs that break your applications”. Con strict: true en la herramienta, el esquema se valida.
  4. Deja un campo de incertidumbre. Un confianza: alta | media | baja y un motivo de una línea. Anthropic recomienda dar permiso explícito al modelo para admitir que no sabe, y ese permiso va escrito en el prompt.
  5. Calcula la puntuación fuera del modelo. Los campos extraídos entran en tu fórmula, en una hoja o en el CRM. El modelo lee, tu regla puntúa.
  6. Revisa a mano los primeros doscientos leads. Es la única forma de conocer tu tasa de error real.

El paso cinco es el que más discusiones genera y el que menos negocio. Si el LLM devuelve la puntuación, pierdes la capacidad de explicar por qué un lead sacó 62 y no 71. Con la fórmula fuera, cualquiera abre la hoja. Prefiero discutir una hoja.

Ojo con lo que mandas al CRM. Si el lead enriquecido alimenta conversiones offline hacia Google Ads o Meta, el campo tiene que ser la decisión humana, no la propuesta del modelo. Cubro el circuito en integración de CRM y publicidad B2B y la subida en conversiones offline en Google Ads para B2B.

¿Qué tiene que quedar registrado para que sea auditable?

Seis cosas por lead, y caben en una fila de base de datos. Sin esto no tienes un sistema: tienes una caja negra que un día se comportará raro sin que nadie sepa por qué.

  • La entrada literal mandada al modelo, con el texto del formulario.
  • La versión del prompt. Un número que subes cada vez que tocas una coma. Suena excesivo hasta la primera vez que el rendimiento cae y no sabes qué cambió.
  • El identificador exacto del modelo, con su versión.
  • La salida completa, con campos y confianza.
  • La decisión humana final y quién la tomó.
  • La marca de tiempo de cada paso.

Con eso respondes a la pregunta que tarde o temprano llega: por qué este lead acabó abajo.

Hay un beneficio secundario que no esperaba: ese registro es tu conjunto de evaluación gratis. A los tres meses tienes cientos de casos con la propuesta del modelo y la corrección humana al lado. Anthropic sugiere además pedirle que cite la frase exacta que sustenta cada afirmación, y así ves de un vistazo si el “presupuesto: 30.000 euros” salía del mensaje o se lo inventó.

¿Y qué pasa con los datos personales del formulario?

Que los estás enviando a un tercero, y eso se documenta antes de la primera llamada a la API. Tres frentes.

Base jurídica. Necesitas una para este fin concreto. El interés legítimo suele encajar al calificar una petición que la propia persona te ha enviado, pero depende de tu caso y conviene tenerlo escrito, no asumido.

Minimización. La Comisión Europea lo resume con una frase que uso como filtro: los datos personales “should only be processed where it is not reasonably feasible to carry out the processing in another manner”, y deben ser adecuados, pertinentes y limitados a lo necesario. Traducido al pipeline: no mandes el objeto completo del formulario. Manda el texto del mensaje y el dominio del email, porque el nombre y el teléfono no aportan nada a una clasificación de intención.

Conservación. El mismo documento pide guardar los datos el menor tiempo posible. Aquí entra la letra pequeña del proveedor: para la API de Anthropic, la política dice que “we automatically delete inputs and outputs on our backend within 30 days of receipt or generation”, y la documentación de retención añade que los datos conservados nunca se usan para entrenar modelos sin permiso expreso. El plazo de tu propio registro lo fijas tú, y hay que ponerle un número.

Un apunte práctico: cuanto mejor esté el formulario, menos datos personales circulan. Un desplegable de presupuesto evita extraerlo del texto libre, y lo desarrollo en landing pages B2B para captar leads cualificados.

¿Cuándo no merece la pena montar nada de esto?

Cuando recibes menos de treinta o cuarenta leads al mes. Leerlos tú suele ser más rápido, más exacto y no genera ni una línea de documentación de protección de datos. La automatización tiene un coste de montaje y otro de mantenimiento, y ninguno baja con el volumen.

También lo descarto cuando el problema real es otro. Si los leads llegan mal cualificados desde el anuncio, ningún triaje posterior lo arregla: pagas por atraer a la persona equivocada y pagas otra vez por identificarla. El trabajo está antes, en la oferta y en la segmentación, y lo cubro en la guía de generación de leads B2B. Si tampoco sabes cuánto te cuesta un lead cualificado, la guía de coste por lead B2B va antes.

Una advertencia sobre el grado de autonomía. Hablo de una llamada por lead, con esquema fijo y salida verificable. No de un agente que consulta tu CRM, decide y responde emails. La distinción importa: la desarrollo en agentes de Claude para marketing digital.

Preguntas frecuentes

¿Puedo pedirle a la IA que puntúe el lead del 0 al 100?

Puedes. Te devolverá un número que no es reproducible ni explicable, y no podrás justificar por qué ese lead sacó 62 y no 71. Prefiero usar el modelo solo para extraer los campos y calcular la puntuación con mi propia fórmula, fuera de él. Así la aritmética queda auditable.

Depende de si produce efectos significativos sobre la persona. La Comisión Europea limita la decisión totalmente automatizada a tres supuestos y exige garantías como el derecho a intervención humana y a impugnarla. Mi recomendación es simple: ordena la cola con el modelo, que el descarte lo firme alguien.

¿Qué datos del formulario debo enviar al modelo?

Los mínimos. Para clasificar intención basta el texto del mensaje y el dominio del email corporativo. Nombre, apellidos y teléfono no aportan nada ahí, así que no tienen por qué salir de tu sistema. Menos datos es menos riesgo y, casi siempre, mejor prompt.

¿Cuánto se tarda en montar una capa de triaje así?

Con el scoring ya definido, suele ser una semana de trabajo real: esquema, prompt, integración y pruebas. Lo que se alarga es la validación. Revisar a mano doscientos leads lleva lo que lleva, y sin esa fase no conoces tu tasa de error.

¿Hay que avisar al usuario de que un modelo lee su mensaje?

Sí. Encaja en tu política de privacidad: qué se trata, con qué finalidad, qué encargados intervienen y cuánto se conserva. Si además hubiera algún tramo de decisión automatizada, la normativa europea exige informar de su existencia y de la lógica aplicada. Es corto, pero tiene que estar escrito antes.

El modelo lee, tú decides

Lo que hace útil a un LLM aquí no es que puntúe mejor que tú. Es que lee cien mensajes desordenados en un minuto y los deja en una tabla. La decisión sigue siendo humana. La aritmética sigue viviendo en tu hoja.

Cuando me enseñan un sistema de calificación con IA que no funciona, casi siempre encuentro lo mismo: le pidieron al modelo que decidiera y no que leyera. Y como nunca dice “no tengo ni idea de este lead” salvo que le des permiso explícito, devuelve confianza donde no la hay. He visto ese fallo tardar un año en salir a la luz. Con registro de auditoría se destapa en dos semanas.

Si quieres que mire tu flujo de entrada de leads y te diga si esto tiene sentido en tu caso, reserva 30 minutos de consultoría y lo vemos con tus números delante. Prefiero decírtelo antes de que montes nada.

Lionel Fenestraz — Consultor Google Ads & Meta Ads
Lionel Fenestraz
Consultor PPC & CRO Freelance · Google Partner · CXL Certified · Google Ads Search Certified
Más de 7 años gestionando campañas de Google Ads y Meta Ads para marcas de vacation rental, B2B y ecommerce. Trilingüe (ES/EN/FR). Trabajo directamente en tu cuenta — sin intermediarios.
Primera llamada gratuita

¿Tu cuenta de ads podría
rendir mejor?

30 minutos para revisar tu situación y decirte exactamente qué cambiaría. Sin pitch, sin propuesta de venta.

¿Hablamos? Elige tu hora →
30 min · Google Meet · Sin compromiso