- El conjunto de herramientas de Gemini combina herramientas estables como Canvas, Deep Research y Guided Learning con funciones experimentales de Labs.
- La API Gemini habilita flujos de trabajo multimodales y de llamada a funciones en Google Workspace y automatizaciones personalizadas.
- El aprendizaje guiado, Canvas y los agentes convierten a Gemini en un tutor personal y un asistente de trabajo para documentos, presentaciones y correo electrónico.
- Gracias a la integración de Labs, Gemini Enterprise y Workspace, los equipos pueden probar potentes sistemas de IA de forma segura sobre sus propios datos.
La "caja de herramientas Gemini" ya no es solo una frase pegadiza; es el conjunto práctico de aplicaciones, herramientas, agentes y API que Google está integrando discretamente en todo, desde el aprendizaje informal hasta los flujos de trabajo empresariales. En lugar de un único asistente monolítico, Gemini ahora se comporta más como una caja de herramientas donde cada función es un instrumento específico: motor de investigación, tutor, asistente de código, programador de reuniones, creador de diapositivas y mucho más.
Si comprende cómo encajan estas piezas (Canvas, Aprendizaje Guiado, Laboratorios, agentes, Gemini Enterprise y la API de Gemini), puede convertir a Gemini en una herramienta de trabajo muy útil en lugar de un simple chatbot novedoso. A continuación, encontrará un recorrido detallado por esta caja de herramientas: qué se encuentra en el área estable de "Herramientas", qué se está probando en "Laboratorios", cómo Gemini actúa como tutor con imágenes y vídeos, y cómo los desarrolladores pueden integrar la API en Google Workspace para una automatización avanzada.
¿Qué herramientas tiene Gemini a su disposición hoy en día?
Gemini se entiende mejor como una familia de modelos de IA (¿Qué son los modelos lingüísticos?) (Gemini 1.0, Gemini 1.5, Gemini 3, etc.) se distribuyen a través de diferentes interfaces: web, aplicaciones móviles, integración con Workspace y una API para desarrolladores. La idea de la "caja de herramientas" proviene de la forma en que Google ahora agrupa capacidades concretas dentro de la interfaz Gemini, especialmente en la web.
En la web, el selector principal dentro de Gemini está dividido en dos zonas principales: "Herramientas" para funcionalidades estables y listas para la producción y "Laboratorios" para experimentos que aún están en desarrollo. Piensa en "Herramientas" como el destornillador de confianza que usas a diario, mientras que "Laboratorios" es la bandeja donde guardas los prototipos que podrían cambiar de forma la semana que viene.
En dispositivos móviles, las aplicaciones de Gemini están incorporando muchas de estas mismas herramientas (aprendizaje guiado, experiencias similares a Canvas, ayuda con gran cantidad de imágenes), pero se están implementando gradualmente. Si aún no ve una función específica en la aplicación, Google recomienda explícitamente volver a intentarlo más tarde o pasar a gemini.google.com Para ver la última versión en la web.
Internamente, todas estas superficies están respaldadas por la API Gemini, que expone modelos multimodales y llamadas a funciones para que puedas generar contenido, analizar imágenes u orquestar flujos de trabajo mediante código. Esa API es la base de muchas de las automatizaciones de Workspace que veremos más adelante.
Herramientas vs. Laboratorios: cómo Gemini organiza sus funciones
A medida que Gemini ha ido acumulando más botones y modos, Google ha introducido una separación más clara entre las funciones maduras y las experimentales a través de dos secciones: "Herramientas" y "Laboratorios". Este cambio ya es visible en la interfaz web y se está implementando progresivamente desde los servidores de Google, por lo que no todas las cuentas verán el mismo diseño al mismo tiempo.
La sección "Herramientas" es donde Google agrupa las funcionalidades que considera estables y predecibles para el uso diario. Según informes de fuentes como Android Police y 9to5Google, esta área incluye elementos como Deep Research, generación de imágenes, creación de vídeos a través de Veo, Canvas, aprendizaje guiado y Deep Think, a veces vinculados a niveles de suscripción específicos como Google AI Pro o Google AI Ultra.
“Labs”, por otro lado, es el espacio de experimentación explícito: un área dedicada dentro del selector Gemini que agrupa las funciones marcadas como experimentales. Normalmente verás iconos con un pequeño matraz de laboratorio y etiquetas como Agente Géminis, Vista Dinámica (también llamada Diseño Visual) e Inteligencia Personal. Al hacer clic en cualquier elemento de la sección Laboratorios, ten en cuenta que su comportamiento puede cambiar, desaparecer o moverse sin previo aviso.
Desde el punto de vista del diseño del producto, esta separación es importante para generar confianza. Cuando una aplicación de IA crece rápidamente, el riesgo no reside solo en tener "demasiadas funciones", sino también en "no saber en qué funciones puedo confiar". Al ubicar las herramientas de uso diario en una zona y los experimentos en otra, Gemini señala el riesgo de forma similar a como se distingue entre el modo "normal" y el modo "deportivo" en un coche.
Las herramientas estables de Gemini: Investigación profunda, Canvas, Aprendizaje guiado y más.
La caja de herramientas principal de Gemini para la mayoría de los usuarios se encuentra en "Herramientas", donde encontrarás las experiencias en torno a las cuales Google quiere que desarrolles hábitos. Si bien la lista exacta de elementos varía según la cuenta y el nivel de suscripción, algunos elementos ya son fundamentales.
Deep Research transforma a Gemini en un asistente de investigación estructurado, en lugar de un modelo de chat genérico. Cuando se formula una pregunta que requiere consultar múltiples fuentes, la Investigación Profunda sigue un proceso más explícito de varios pasos, lo que da como resultado una metodología coherente para que los usuarios sepan qué esperar cada vez que la utilicen.
Las herramientas de creación de contenido para imágenes y vídeo, incluidas las integraciones con tecnología de Veo, también se encuentran en el cajón de Herramientas. Los usuarios que dependen de Gemini para contenido visual necesitan que estas funcionalidades sean fáciles de encontrar y razonablemente estables, y no que estén ocultas tras indicadores experimentales cambiantes.
Canvas es otro pilar fundamental: un modo de espacio de trabajo donde puedes iniciar un documento o proyecto de codificación directamente desde una línea de comandos, para luego refinarlo iterativamente con Gemini. Debajo de la barra de solicitud, puede seleccionar "Lienzo" e introducir su mensaje para generar un punto de partida para el contenido o el código, y luego seguir editando en un diseño interactivo en paralelo.
Las funciones de Aprendizaje Guiado y Pensamiento Profundo completan las herramientas más centradas en el desarrollo cognitivo, especialmente para los usuarios que desean ayuda estructurada con temas complejos. El aprendizaje guiado puede comportarse como un tutor, explicándote las ideas paso a paso, mientras que el pensamiento profundo fomenta un razonamiento más lento y deliberado sobre cuestiones complejas.
Géminis como tutor personal: aprendizaje guiado, imágenes y vídeos.
Uno de los aspectos más prácticos de la herramienta Gemini es su capacidad para funcionar como un profesor particular, combinando secuencias guiadas con explicaciones visuales. En lugar de presentar un texto extenso, Gemini puede incorporar imágenes, bocetos e incluso vídeos en sus respuestas para facilitar la comprensión de los conceptos.
En términos prácticos, puedes pedirle a Géminis que te explique un tema y solicitarle explícitamente un diagrama, un desglose visual o una imagen ilustrativa. La respuesta puede incorporar esas imágenes directamente en la explicación, lo que ayuda a visualizar, por ejemplo, un concepto matemático, un flujo de trabajo o un proceso científico.
También se admite el aprendizaje basado en vídeos, aunque los detalles varían según la región y la fase de implementación. Para algunos temas, Gemini puede mostrar o hacer referencia a vídeos que complementan su respuesta textual, creando una ruta de aprendizaje más multimodal donde se lee, se mira y se interactúa con las preguntas de forma simultánea.
Este modo de enseñanza se está introduciendo gradualmente en las aplicaciones móviles de Gemini, por lo que es posible que no veas todas las opciones de inmediato. Cuando eso sucede, la alternativa es utilizar la experiencia web, donde el conjunto de funciones de Gemini suele aparecer antes durante los despliegues graduales.
Gemini Enterprise y Workspace: agentes de IA para equipos
Más allá del uso personal, el conjunto de herramientas de Gemini se extiende al entorno laboral a través de las integraciones con Gemini Enterprise y Google Workspace. Aquí, la atención se centra en agentes persistentes, flujos de trabajo y colaboración a gran escala, en lugar de en solicitudes puntuales.
Google describe Gemini Enterprise como una plataforma de agentes avanzada que pone lo mejor de la IA de Google al alcance de todos los empleados y flujos de trabajo. En la práctica, permite a los equipos descubrir, crear, compartir y ejecutar agentes de IA en un entorno seguro respaldado por los datos de su propia empresa, lo que reduce los cuellos de botella en el desarrollo y habilita casos de uso como el análisis de ventas, la automatización de procesos y la búsqueda de conocimiento interno.
Google Workspace funciona como una plataforma de colaboración potenciada por Gemini, con inteligencia artificial integrada en aplicaciones como Gmail, Docs y Meet. En lugar de recurrir a una herramienta de IA independiente, los usuarios pueden utilizar Gemini dentro de sus aplicaciones de productividad cotidianas para redactar contenido, resumir información o generar ideas en contexto.
En algunas configuraciones, incluso puedes chatear directamente con Gemini a través de los datos de tu empresa almacenados en Google Workspace, Microsoft 365 y otros sistemas conectados. Esto convierte a Gemini en una capa de conocimiento corporativo que puede responder preguntas basadas en correos electrónicos, documentos y archivos, sujeto a los permisos y la configuración de seguridad establecidos por el departamento de TI.
La API de Gemini: la columna vertebral del conjunto de herramientas para desarrolladores
Debajo de las aplicaciones Gemini orientadas al usuario se encuentra la API de Gemini, que expone los mismos modelos básicos para que los desarrolladores los integren en sus propias aplicaciones. Esta API es donde la multimodalidad, la llamada a funciones y los flujos de trabajo personalizados se combinan para lograr una automatización avanzada, en particular con Google Workspace y Apps Script.
Los modelos Gemini son los sistemas de IA más potentes de Google, y la API proporciona varias variantes de modelos, como versiones centradas en texto y versiones orientadas a la visión, cada una con capacidades y limitaciones específicas. Puedes explorarlos visualmente en Google AI Studio, una interfaz alojada que te permite probar sugerencias, ajustar la configuración del modelo e incluso optimizar modelos personalizados sin necesidad de escribir código.
Para empezar a usar la API, debes solicitar una clave de API a través de Google AI Studio u otra consola compatible, y luego probarla con una simple llamada REST. Por ejemplo, puede exportar su clave a una variable de entorno como GOOGLE_API_KEY e invocar el punto final que enumera los modelos disponibles, recibiendo JSON como modelos/gemini-1.0-pro si todo está configurado correctamente.
A partir de ahí, generar contenido es cuestión de enviar una carga útil JSON mediante POST al punto final apropiado, como por ejemplo: generarContenido método para un modelo elegido. Una solicitud mínima incluye una contenido campo con partes de texto, aunque opcional configuración de generación y Configuración de seguridad te permite controlar parámetros como la temperatura y los filtros de seguridad.
Llamar a la API de Gemini desde Apps Script
Uno de los patrones más potentes del conjunto de herramientas de Gemini es la combinación de la API con Google Apps Script para automatizar flujos de trabajo dentro de Workspace. Este enfoque permite integrar Gemini con servicios como Drive, Calendar, Gmail, Sheets y Slides sin necesidad de construir un backend completo.
La configuración estándar comienza con un proyecto de Apps Script (por ejemplo, creado mediante script.new) donde se almacena la clave API de Gemini como una propiedad del script. En el código, recuperas ese valor y construyes una URL de punto final para un modelo específico, a menudo gemini-1.0-pro-latest:generateContent con su clave API pasada como parámetro de consulta.
Una función auxiliar como llamarGemini(mensaje, temperatura) normalmente crea una carga útil JSON y la envía a través de UrlFetchApp.fetch y analiza la respuesta para extraer el texto generado. Este envoltorio simplifica el uso repetido de la API desde diferentes utilidades en su script.
Las pruebas son sencillas: puede crear una testGemini() Función que define un mensaje, llama a su función auxiliar y registra tanto la entrada como la salida en los registros de ejecución. Una vez que eso funcione, sabrás que tu entorno de Apps Script y tu clave API de Gemini están configurados correctamente para escenarios más avanzados.
Utilizando el punto final Gemini Vision para imágenes
La caja de herramientas Gemini va más allá del texto gracias a la compatibilidad multimodal, especialmente a la capacidad de procesar imágenes a través de un dispositivo con capacidad de visión artificial. En Apps Script, esto suele ser un punto final separado como por ejemplo: gemini-1.0-pro-vision-latest:generateContent, nuevamente parametrizado por su clave API.
Un ayudante típico como callGeminiProVision(mensaje, imagen, temperatura) convertirá un blob de imagen en base64, lo incrustará como datos en línea con el tipo MIME apropiado y envíelo junto con una solicitud de texto. A continuación, el modelo devuelve un texto que refleja su comprensión tanto de la imagen como de la consigna.
Para verificar la configuración, podría escribir un pequeño testGeminiVision() que descarga una imagen de muestra desde una URL pública, se la pasa a tu asistente y registra un dato curioso o un análisis producido por Gemini Vision. Este tipo de prueba demuestra que la entrada multimodal funciona correctamente en su entorno.
Una vez que el flujo de visión se haya estabilizado, podrá reutilizarlo en automatizaciones de nivel superior, como el análisis de gráficos de Google Sheets o imágenes almacenadas en Drive. Ahí es donde la multimodalidad empieza a sentirse como una parte realmente útil del conjunto de herramientas, en lugar de un truco de demostración.
Llamada a funciones: otorgando a Gemini acceso a herramientas
Otro elemento clave del conjunto de herramientas de Gemini es la llamada a funciones, que permite al modelo decidir cuándo invocar tus propias herramientas o API. En lugar de simplemente generar texto, Gemini puede devolver texto estructurado. Llamada a función objetos que describen qué función usar y con qué argumentos.
En Apps Script, puedes configurar un asistente como por ejemplo: llamarGeminiWithTools(mensaje, herramientas, temperatura) que envía un especificación junto con la solicitud al usuario. Esta especificación sigue una Declaración de función esquema, donde se describe el nombre de la función, su propósito y los parámetros JSON.
Cuando Gemini decide que se debe usar una herramienta, su respuesta incluye un objeto de llamada a función que puedes analizar en tu script y redirigir a la implementación real. Por ejemplo, podrías definir una herramienta auxiliar llamada "datetime" que devuelva la fecha y hora actuales, y observar cómo Gemini solicita esa función para resolver cuestiones relacionadas con cálculos de calendario.
La llamada a funciones es especialmente potente porque puede operar a lo largo de varios turnos, no solo en solicitudes puntuales. Esto significa que puedes diseñar agentes conversacionales más complejos que decidan cuándo usar las herramientas, interpreten los resultados y continúen el diálogo.
Integraciones de demostración: Gemini + Google Workspace como un conjunto de herramientas prácticas
Una vez que se combinan la generación de texto, la entrada de visión y la llamada a funciones, la caja de herramientas Gemini se convierte en un motor práctico para la automatización de espacios de trabajo. El material del codelab de Google describe varios ejemplos concretos que ilustran lo que es posible.
En términos generales, las consultas de los usuarios se transmiten a Gemini con un conjunto de herramientas disponibles que representan diferentes flujos de trabajo: programación de reuniones, redacción de correos electrónicos a partir de gráficos y creación de presentaciones. En función de la consulta, Gemini elige la función adecuada y devuelve una llamada a la función con argumentos estructurados como horas, nombres de archivos o temas.
En tu Apps Script, luego interpretas la llamada a la función dentro de un si…de lo contrario cadena, invocando el flujo de trabajo apropiado, por ejemplo, configurarReunión(), borradorCorreo electrónico() or crearMazo(). Esta combinación de razonamiento basado en modelos y lógica de script explícita es lo que convierte a Gemini de una ventana de chat en una caja de herramientas para el trabajo real.
Automatización de reuniones: resumen de archivos de Drive en eventos del calendario
Una demostración muestra cómo Gemini puede ayudar a configurar una reunión en el Calendario que incluya automáticamente un resumen de un archivo de texto alojado en Google Drive. El usuario podría escribir algo como: “Programar una reunión mañana a las 10 AM con Helen para hablar sobre las noticias del archivo Gemini-blog.txt”.
En segundo plano, en la especificación de herramientas se declara una herramienta de espacio de trabajo llamada "setupMeeting", con parámetros para la hora, el destinatario y el nombre del archivo. Cuando Gemini interpreta la consulta, elige esta herramienta y devuelve una llamada a una función con esos argumentos ya completados.
El correspondiente configurarReunión() La función luego encuentra el archivo especificado en Drive, lee su contenido y lo pasa a Gemini a través de llamarGemini() con instrucciones para generar un objeto JSON corto que contenga un título y un breve resumen. La respuesta puede venir envuelta en delimitadores de formato que deberá eliminar antes de analizarla como JSON.
Utilizando el título y el resumen extraídos, el script crea un evento de calendario utilizando Aplicación de calendario, establece la descripción en el resumen y adjunta el archivo fuente a través del servicio avanzado de Calendario. El resultado es una reunión programada con el contexto incorporado, todo ello desencadenado por una única solicitud en lenguaje natural.
Redacción de correos electrónicos a partir de gráficos de Hojas de cálculo con Gemini Vision.
Otro flujo de trabajo en el conjunto de herramientas de Gemini consiste en analizar un gráfico en Google Sheets y redactar un mensaje de Gmail basándose en él. Imagina que llevas una hoja de cálculo con los gastos universitarios y quieres enviar un correo electrónico que resuma lo que muestra la tabla para una compañera llamada Mary.
La consulta del usuario podría ser: "Redacta un correo electrónico para Mary con información relevante del gráfico en la hoja de cálculo CollegeExpenses". Se ha definido una herramienta llamada "draftEmail" para aceptar un nombre de hoja y un destinatario, y Gemini elige esa herramienta cuando detecta este tipo de solicitud.
El borradorCorreo electrónico() Esta función localiza la hoja de cálculo solicitada en Drive, abre la hoja correspondiente, recupera su primer gráfico y lo guarda como un archivo (por ejemplo, ExpenseChart.png). A continuación, se genera un mensaje que indica a Géminis que utilice únicamente la información de la carta astral, evite las comparaciones históricas y mantenga el mensaje conciso.
Llamando llamarGeminiProVision(prompt, expenseChart)El script envía tanto la solicitud como la imagen del gráfico a Gemini Vision, que devuelve un cuerpo de correo electrónico personalizado. Finalmente, el script crea un borrador de Gmail dirigido al correo electrónico del destinatario, establece un asunto como "Gastos universitarios" y adjunta la imagen del gráfico.
Este patrón convierte eficazmente a Géminis en un analista capaz de interpretar un gráfico, extraer la información clave y expresarla en lenguaje natural en tu nombre. Aun así, usted revisa y ajusta el borrador, pero la mayor parte del trabajo pesado se realiza automáticamente.
Crea presentaciones de diapositivas automáticamente con Gemini y Google Slides.
El tercer flujo de trabajo de demostración principal de esta caja de herramientas crea automáticamente una presentación básica de Google Slides sobre un tema especificado por el usuario. Por ejemplo, podrías preguntar: "Ayúdame a preparar una presentación sobre la conservación del agua".
Se declara una herramienta llamada "createDeck" con un único parámetro, topic, y se le indica a Gemini que devuelva un JSON estructurado que describa una serie de diapositivas. La solicitud le indica a Gemini cuántas diapositivas crear (en función de una constante como NUM_SLIDES), solicita títulos breves y viñetas, y pide explícitamente un objeto JSON válido para que el script pueda analizarlo de forma segura.
Después de llamar llamarGemini() Con esa indicación, el script elimina cualquier delimitador de formato, analiza el JSON y luego utiliza Aplicación de diapositivas para generar una nueva presentación. La primera diapositiva se trata como la página de título, y las diapositivas subsiguientes siguen un diseño TÍTULO_Y_CUERPO donde el script rellena el título y el texto con viñetas.
En cuestión de segundos, obtendrás una presentación básica con puntos clave estructurados por diapositiva, lista para que la personalices visualmente. Aunque el resultado es intencionadamente mínimo, este flujo de trabajo muestra cómo Gemini puede impulsar la estructura del contenido para que puedas centrarte en el diseño y los matices.
Ampliando el conjunto de herramientas: chatbots, RAG y herramientas de múltiples turnos.
Los ejemplos anteriores son solo un punto de partida; el conjunto de herramientas de Gemini se puede ampliar en muchas direcciones una vez que te familiarices con la API y la llamada a funciones. Google sugiere explícitamente varias vías de exploración.
Un caso de uso común es la creación de chatbots para Google Chat utilizando la API Gemini. Aquí se aplican los mismos patrones: se exponen las herramientas, se deja que Gemini decida cuándo llamarlas y se conectan las respuestas a una interfaz conversacional dentro de Chat, todo ello regido por la API de Chat y los laboratorios de código asociados.
Otra tendencia importante es la generación aumentada de recuperación (RAG, por sus siglas en inglés) sobre el contenido privado en Drive o Keep. En lugar de resumir un único archivo de texto, puede combinar la API de Gemini con una base de datos vectorial y, opcionalmente, con un marco de orquestación como LangChain para obtener fragmentos relevantes de archivos PDF, imágenes y notas antes de pedirle a Gemini que genere una respuesta basada en esos documentos.
La llamada a funciones de múltiples turnos también permite el desarrollo de agentes más sofisticados que pueden decidir de forma iterativa qué herramientas utilizar y en qué secuencia. En lugar de tomar una única decisión, un agente puede llamar a una función, examinar el resultado y luego llamar a otra función o hacer una pregunta aclaratoria, todo dentro de un mismo hilo de conversación.
Por último, no es necesario permanecer dentro de Workspace; una vez que domines los patrones de la API de Gemini, podrás conectar el modelo a API externas en toda la web. Así es como Géminis pasa de ser un asistente corporativo limitado a un orquestador de propósito general del trabajo digital.
En conjunto, estos componentes (herramientas estables, laboratorios experimentales, funciones de tutoría, agentes empresariales y la API para desarrolladores) conforman una caja de herramientas Gemini realmente completa que puede adaptarse tanto a usuarios ocasionales como a usuarios avanzados. Si tratas a Gemini no tanto como una sola aplicación, sino más bien como un conjunto creciente de instrumentos que puedes combinar, estarás en una posición ventajosa para aprovechar cualquier novedad que Google añada sin tener que replantearte todo tu flujo de trabajo cada vez.
Ingeniero. Amante de la tecnología, el software y el hardware y bloguera tecnológica desde 2012

