Antes, elegir un modelo de IA significaba suscribirse a varios servicios distintos y esperar que alguno funcionara. Amazon Bedrock (un servicio de AWS que aloja modelos de IA de muchos proveedores bajo un mismo techo, como un servicio de streaming que ofrece varios canales) te permite probar modelos de Anthropic, Meta, Mistral, Cohere y Amazon desde una sola consola. Aquí te explicamos cómo usarlo de verdad para compararlos.
Qué necesitas antes de empezar
- Una cuenta de AWS. Regístrate en la web de AWS si todavía no tienes una. La cuenta en sí es gratis, pero cada invocación de un modelo cuesta dinero.
- Solicitudes de acceso a modelos. Algunos modelos —sobre todo Anthropic Claude y Meta Llama— no aparecen en tu catálogo hasta que envíes una solicitud de acceso breve. Lo encontrarás en Model access, en el menú de la izquierda de la consola de Bedrock.
- Una región operativa. Bedrock está disponible en regiones como us-east-1, us-west-2, eu-west-1 y ap-southeast-2 (Sídney). Sídney es clave si quieres que tus datos se queden en Estados Unidos.
- Una alerta de facturación. Activa un presupuesto en AWS Billing antes de empezar a probar, para que un bucle de prompts descontrolado no te sorprenda a fin de mes.
Paso 1 — Inicia sesión y abre Bedrock
Dónde ir: inicia sesión en la consola de AWS Management desde tu navegador. Escribe "Bedrock" en la barra de búsqueda de la parte superior de la página y haz clic en Amazon Bedrock en los resultados.
Qué verás: la página de inicio de Bedrock. En el panel de navegación de la izquierda aparecerán opciones como Foundation models, Playgrounds y Custom models. Si es tu primera visita, también verás un botón verde de "Get started".
💬 Ruta de menú para copiar: Services menu → Machine Learning → Amazon Bedrock.
Sabrás que funcionó cuando cargue la consola de Bedrock y puedas ver Foundation models en la navegación de la izquierda.
Paso 2 — Explora el catálogo de Foundation Models
Dónde ir: en la navegación de la izquierda, haz clic en Foundation models (a veces aparece como Model catalog en las versiones más nuevas de la consola).
Qué verás: una lista de fichas de modelos agrupadas por proveedor —Anthropic, AI21, Cohere, Meta, Mistral, Amazon y Stability AI. Cada ficha muestra el nombre del modelo, una descripción breve, el tamaño de la ventana de contexto (la cantidad máxima de texto que el modelo puede leer de una sola vez) y los tipos de entrada admitidos.
💬 Filtro para copiar: escribe claude o llama en el cuadro de búsqueda de la parte superior del catálogo para acotar la lista.
Sabrás que funcionó cuando puedas identificar al menos tres fichas de modelos con su tamaño de ventana de contexto visible (por ejemplo, 200,000 tokens en Claude Sonnet).
Paso 3 — Abre el Chat Playground
Dónde ir: en la navegación de la izquierda, haz clic en Playgrounds y elige Chat en el menú desplegable que aparece.
Qué verás: una interfaz de chat a pantalla dividida. A la derecha está el panel de mensajes; a la izquierda están los ajustes del prompt de sistema (las instrucciones que le das a la IA antes de que empiece la conversación), un selector de modelo y los parámetros de inferencia (los controles que regulan cómo responde la IA, como la temperatura y los tokens máximos).
💬 Prompt inicial para copiar:
Eres un asistente útil para una pequeña empresa estadounidense de contabilidad. Responde en inglés sencillo, máximo 80 palabras.
Sabrás que funcionó cuando la IA responda en el panel de la derecha en unos segundos y la respuesta esté en inglés sencillo.
Paso 4 — Cambia de modelo y compara respuestas
Dónde ir: en el Chat Playground, busca el menú desplegable Model cerca de la parte superior de la pantalla —muestra el nombre del modelo actual, por ejemplo "Claude Sonnet". Ábrelo, elige otro modelo (por ejemplo Claude Haiku o una variante de Llama) y envía el mismo prompt otra vez.
Qué verás: una respuesta nueva del nuevo modelo en el mismo panel de chat. El tono, la extensión y la estructura suelen cambiar, que es justo la idea del ejercicio.
💬 Prompt de comparación para copiar:
Escribe un correo educado de 50 palabras para rechazar una invitación a una reunión. Mantén un tono amable pero firme.
Sabrás que funcionó cuando tengas dos respuestas claramente distintas de dos modelos diferentes en el mismo panel, y hayas anotado cuál se parece más a lo que tu negocio realmente necesita.
Paso 5 — Consulta el precio de cada modelo
Dónde ir: vuelve a las fichas de modelos en el catálogo de Foundation Models, donde aparecen los precios de entrada y salida debajo de cada modelo. También puedes abrir la página de precios de Bedrock en una pestaña nueva del navegador para ver la tabla completa.
Qué verás: una tabla de precios con dos cifras por modelo: input (por cada 1,000 tokens) y output (por cada 1,000 tokens). Un token equivale, aproximadamente, a cuatro caracteres de texto —unas tres cuartas partes de una palabra en inglés.
💬 Truco mental para copiar:
1,000 tokens ≈ 750 palabras en inglés.
Un correo típico de cliente: 150–200 tokens de entrada, 100 tokens de salida.
Sabrás que funcionó cuando puedas citar el precio por cada 1,000 tokens de al menos dos modelos diferentes sin consultar ninguna web externa.
Paso 6 — (Opcional) Ejecuta un trabajo de Model Evaluation
Dónde ir: en la navegación de la izquierda, haz clic en Model evaluation (a veces aparece como Evaluations). Elige Create evaluation, sube un conjunto pequeño de datos de prompts con respuestas esperadas y selecciona dos o más modelos para comparar.
Qué verás: un panel de evaluación con puntuaciones de precisión, latencia (tiempo de respuesta en segundos) y ejemplos de respuestas lado a lado cuando termine el trabajo.
💬 Encabezado CSV para copiar en tu dataset de prompts:
prompt,expected_output
"Resume este correo en una frase","Un resumen breve"
Sabrás que funcionó cuando la evaluación termine (puede tardar desde 30 minutos hasta varias horas, según el tamaño) y puedas elegir un ganador basándote tanto en calidad como en coste, y no solo en la intuición.
Errores frecuentes
- Error: elegir el modelo más caro para todo. Solución: empieza con un modelo más pequeño y barato y sube solo cuando su resultado no sea suficiente. Muchos negocios gastan de más al usar modelos premium en tareas que un modelo económico podría resolver.
- Error: comparar modelos con prompts distintos. Solución: envía exactamente el mismo prompt y las mismas instrucciones de sistema a cada modelo que pruebes — si no, estarás midiendo lo bueno que es tu prompt, no lo bueno que es el modelo.
- Error: saltarse la alerta de facturación. Solución: abre Billing & Cost Management en la consola de AWS, fija un presupuesto inicial de unos 50 dólares y activa alertas por correo al 50 % y al 90 % del presupuesto.
- Error: asumir que una ventana de contexto más grande significa un modelo más inteligente. Solución: una ventana de contexto mayor solo significa que el modelo puede leer más texto a la vez. Para medir la calidad pura, mira benchmarks independientes y los resultados de tus propias pruebas con tu tarea real.
Qué significa esto para ti
- Si diriges una pequeña empresa: empieza con un modelo económico como Claude Haiku o una variante de Llama para tareas del día a día, como redactar respuestas. Sube a un modelo más capaz solo cuando el resultado realmente lo requiera.
- Si gestionas un equipo: estandariza uno o dos modelos para que cada persona no esté pagando por servicios distintos. Reúne los modelos y prompts elegidos en un documento compartido.
- Si te importa la residencia de datos en Estados Unidos: usa la región ap-southeast-2 (Sídney). No todos los modelos están disponibles en todas las regiones, así que comprueba en el catálogo qué hay en Sídney antes de comprometerte.
