Discussion Paper · Research Division · August 2026Documento de Discusión · División de Investigación · Agosto de 2026

Vibe Governing for Developing Countries

How Artificial Intelligence Lets Latin America and the Caribbean Leapfrog the Analytical StateCómo la inteligencia artificial permite a América Latina y el Caribe dar un salto en la capacidad analítica del Estado

Partnership for the Americas  |  research@partnershipamericas.org

17,000
Analysts in the UK government's cross-department Analysis Function — the bench developing countries were told to replicateAnalistas en la Función de Análisis del gobierno británico: la banca técnica que se pidió replicar a los países en desarrollo
~700×
Cost of one developed-country government economist vs. a year of a frontier AI subscriptionCosto de un economista de gobierno de país desarrollado frente a un año de suscripción a una IA de frontera
98.2%98,2%
Frontier-model performance in Spanish relative to English (Portuguese: 97.8%)Desempeño de los modelos de frontera en español relativo al inglés (portugués: 97,8%)
+34%
Productivity gain for novice workers using AI — the floor rises faster than the ceilingGanancia de productividad de los trabajadores novatos con IA: el piso sube más rápido que el techo

The Bench Gap

For the past half-century, the most under-appreciated advantage of developed-country governments has not been wealth, technology, or even institutions in the abstract. It has been bench depth: the ability to assign large numbers of specialized, permanent, professional staff to any analytical problem the state encounters. The United States federal executive branch employs roughly 4,440 economists, 4,750 statisticians, and 68,590 management analysts.1 Its legislature is backed by the Congressional Budget Office (~275 advanced-degree analysts), the Congressional Research Service (~600 staff), and the Government Accountability Office (~3,500 staff, whose work returned $76 for every dollar invested in fiscal year 2024).2 The United Kingdom runs a cross-government Analysis Function of roughly 17,000 analysts, including more than 3,500 economists in the Government Economic Service — the largest employer of economists in the country — over 12,000 statistical professionals, and a policy profession of nearly 38,000 civil servants.3

No government in Latin America or the Caribbean has ever been able to field such a bench, and the gap is measurable. On the World Bank's Statistical Performance Index, the regional average is 66 out of 100, against 93.4 for the United States and 88.9 for the United Kingdom — with Haiti and several Caribbean states below 40.4 The Inter-American Development Bank's Civil Service Development Index, which measures merit and technical capacity in public employment across the region, recorded a regional average below 40 out of 100 in its most recent published editions.5 On the World Bank's Government Effectiveness indicator, the regional average sits near −0.3 on a scale where developed economies cluster around +1.4.6 Most legislatures in the region have no equivalent of a budget office at all; Argentina established its first congressional budget office only in 2016.

The conventional response — four decades of technical assistance and capacity-building programs aimed at replicating the developed-country bench through training and institution-building — has produced real but slow gains. The bench was never hireable at developing-country budgets: central government payroll in the region already absorbs roughly 5.8 percent of GDP, about 41 percent of tax revenues.5 Meanwhile the deepest benches in the world remain expensive even for their owners. The United Kingdom, with its 17,000 government analysts, still spent a record £3.7 billion on external consultants in fiscal 2024/25.7 Even the United States concluded in 1995 that it could not afford the Office of Technology Assessment, whose 750 major studies had averaged eighteen months each. Deep analysis has always been scarce, everywhere.

Exhibit 1 · The statistical capacity gap — and its spread inside the region
World Bank Statistical Performance Index, 2023 (0–100). LAC average is an unweighted mean of 32 countries.
This paper argues that the constraint just moved. For the first time, the analytical capacity of a developed-country government is available to any government, in its own language, at the price of a telephone plan — and the governments with the least legacy bureaucracy to defend are positioned to adopt it fastest.

The Leapfrog Pattern

Technological leapfrogging is not a metaphor; it is a documented regularity with known conditions. The economics literature identifies three: a paradigm shift that collapses the cost of a capability, incumbents locked into sunk investments in the old way of providing it, and latecomers with unmet demand and no vested interests defending the status quo.8 When all three hold, latecomers do not catch up gradually — they skip the stage entirely.

The region and the wider developing world have passed this test repeatedly. Sub-Saharan Africa never built landlines — fixed-line subscriptions peaked below 1.5 per 100 people — and went directly to mobile, which rose from 1.7 to 90 subscriptions per 100 people between 2000 and 2023.9 Kenya's M-Pesa took formal financial inclusion from 27 percent to over 80 percent of adults within a decade and measurably reduced poverty.10 India enrolled over a billion people in a biometric identity system in roughly six years. And Latin America has produced leapfrogs of its own. Brazil's Pix, an instant-payment system launched by the central bank in November 2020, enrolled 67 percent of Brazilian adults within fourteen months, processed 63.4 billion transactions in 2024, and gave an estimated 50 million Brazilians their first digital payment — overtaking credit and debit cards combined in under four years.11 Uruguay ranks second in the Americas on the UN E-Government Development Index, ahead of Canada.12 Brazil's gov.br platform counts 166 million registered users.

Exhibit 2 · Brazil’s Pix: a state-built leapfrog at national scale
Pix transactions per year, billions. Source: Banco Central do Brasil via BIS / Payments CMI.

Two early governance cases suggest the pattern is already extending to the analytical state itself. Buenos Aires' WhatsApp-based assistant Boti handles more than three million citizen conversations per month across 1,300 city procedures, now running generative AI with a retrieval accuracy of 98.9 percent against official sources.13 Brazil's judiciary, facing 76 million pending cases, has deployed more than 140 AI projects since 2019; judges closed 75 percent more cases in 2024 than in 2020, and the Supreme Court's backlog reached its lowest level since 1992 — gains that reflect AI together with broader procedural reforms, but that no observer believes could have been achieved by hiring alone.14

The third leapfrog condition — incumbent lock-in — is visible on the other side of the ledger. The United Kingdom's National Audit Office found in 2024 that only 37 percent of surveyed government bodies had deployed AI at all, most in one or two use cases, citing skills, legal liability, and reliability concerns.15 A developed-country government must integrate AI into a bench of tens of thousands of salaried professionals, procurement regimes, and institutional routines. A ministry with three analysts has nothing to displace.

The Double Unlock

What makes the current moment categorically different from previous waves of "e-government" is that artificial intelligence removes two constraints simultaneously — the cost of expertise and the language of expertise. Either alone would be incremental. Together they change the production function of governing.

The cost of expertise

The evidence that large language models compress skill gaps is now among the most replicated findings in the economics of AI. In the largest field experiment to date, an AI assistant raised the productivity of customer-support workers by 14 percent on average — but by 34 percent for novice workers, with minimal effect on the most experienced, effectively transmitting the tacit practices of top performers to everyone else.16 A randomized experiment with 758 consultants found quality gains of roughly 40 percent, concentrated among the bottom half of performers (+43 percent, versus +17 percent for the top half).17 A controlled study of professional writing tasks found time savings of 40 percent, quality gains of 18 percent, and — critically — a compression of the gap between weaker and stronger writers.18 The pattern is consistent: AI raises the floor far more than the ceiling. Developed-country governments are ceiling-constrained; most governments in this region are floor-constrained. The relative gains flow to the capacity-scarce.

The arithmetic is stark. A single US-grade government economist costs approximately $173,000 per year fully loaded.1 A frontier AI subscription costs roughly $240 per year — about 700 seats for the price of one economist — and the direction of travel is toward zero: in August 2025, the US General Services Administration negotiated frontier AI access for the entire federal government at one dollar per year per vendor.19

Exhibit 3 · AI raises the floor: gains concentrate among the less experienced
Productivity gains with AI assistance, randomized and quasi-experimental studies. Sources: Brynjolfsson et al. (QJE 2025); Dell’Acqua et al. (2023).

The language of expertise

The second unlock is the one this paper's audience has lived. The global knowledge base was assembled in English: roughly half of measured web content, about 90 percent of the text on which early large models were trained, and — most tellingly — 98.9 percent of the 1.48 billion citations in global science point to English-language work.20 The costs of that arrangement were personal and quantifiable. Researchers working in a second language report needing up to twice as long to read and write papers, and face 2.5 times higher rejection rates for language-related reasons.21 Across the region, only Argentina rates "High" on the EF English Proficiency Index; Brazil and Colombia rate "Low," Mexico "Very Low."22 The professional elite that could consult global knowledge fluently was, in practice, the elite that spoke English.

Exhibit 4 · The language wall as it stood
English vs. Spanish + Portuguese shares of the knowledge base. Sources: W3Techs (2026); OpenAI GPT-3 dataset statistics (2020); Pradier et al., JASIST (2026).

That barrier has substantially dissolved for the region's two major languages. On professionally translated evaluations, Claude Sonnet 4.5 performs at 98.2 percent of its English-language level in Spanish and 97.8 percent in Brazilian Portuguese; on some 2025 benchmarks, frontier models score as well or better in Spanish than in English.23 The capability is professional-grade, not conversational: Claude 3.5 Sonnet passed all twenty-one editions of the Brazilian bar association's written legal-drafting examination in Portuguese, with a higher average score than models specifically specialized in Portuguese.24 Interpretability research indicates why: large models increasingly process meaning in a language-agnostic conceptual space, so knowledge absorbed in English becomes accessible from a Spanish or Portuguese prompt.25 The residual gap is economic rather than cognitive — Spanish and Portuguese consume roughly a third more tokens per word, a modest cost premium that has fallen with each tokenizer generation.26

Exhibit 5 · The wall dissolving: frontier-model performance by language
Claude Sonnet 4.5, human-translated MMLU, relative to English = 100%. Source: Anthropic (2025). Orange: the region’s two major languages.

The combined effect is already measurable where adoption is furthest along. Analysis of more than two million biomedical papers found AI-assisted writing growing roughly 400 percent in non-English-speaking countries — against 183 percent in English-speaking ones — and found that higher AI adoption narrowed the publication gap between them.27 What is documented for science is this paper's argument for government: a budget directorate can now consult, in Spanish, the same global corpus a Washington or Whitehall analyst consults in English, and produce staff work of comparable finish.

We use the term vibe governing — borrowed, deliberately, from "vibe coding," which took software production from specialists to anyone who can describe intent — for the serious version of this practice: the natural-language, iterative delegation of analytical production to AI systems, with direction, judgment, and accountability retained by human officials. The term deserves a moment of candor, because it did not enter the lexicon as a compliment. It was coined in April 2025, when analysts observed that a US tariff formula closely resembled what chatbots produce when asked about trade deficits, and "vibe governing" came to mean asking a model what to do and shipping the answer unexamined.33 The episode's most instructive detail is usually omitted: the models had attached substantive caveats to their answers, and the decision-makers ignored them. That is not an argument against governing with AI; it is an argument against governing without verification — a failure of process available to any government, with or without a model. This paper argues for the disciplined version. What is delegated is production: drafting, modeling, translation, statistical review, comparative legal research. What is never delegated is authorization: the choice of objectives, the vetting of outputs, and the signature.

Adoption is not hypothetical. On Anthropic's index of per-capita Claude usage, Peru (1.19), Costa Rica (1.12), Uruguay (1.10) and Chile (1.04) already exceed global expectations for their working-age populations, and the region ranks third worldwide in downloads of generative-AI applications.28
Exhibit 6 · Adoption intensity across the region
Claude usage relative to working-age population; 1.0 = global expectation. Orange: above expectation. Source: Anthropic Economic Index (2025).

The Caribbean Test

An honest version of this argument must state plainly where the language unlock has not yet arrived. The near-parity documented above belongs to Spanish and Portuguese — languages with hundreds of millions of speakers and deep digital corpora. It does not yet extend to the Caribbean's creole languages or the region's indigenous languages. Haitian Creole, the daily language of over ten million people, is represented in research corpora measured in the hundreds of thousands of words; frontier models' performance drops by 20 to 40 points on genuinely low-resource languages, and machine-translation coverage of the Caribbean's creoles remains minimal.29 Quechua, Guarani, and Aymara fare no better.

For the anglophone Caribbean the leapfrog is available immediately — in English, with the additional advantage that these states are among the world's most capacity-constrained by emigration: more than 70 percent of the tertiary-educated workforce of the average Caribbean state has emigrated, rising to 89 percent for Guyana.30 Where the bench cannot be retained, renting one matters most. But for Haiti and for indigenous-language governance, the unlock must be built. Regional efforts have begun — the Chilean-led Latam-GPT consortium spans fifteen countries and has started work on indigenous languages, and open research programs have assembled millions of creole-language sentence pairs31 — yet their budgets are a rounding error beside frontier laboratories. Closing the language tail is the single clearest public-good investment this agenda offers international funders: it is cheap by AI-industry standards, unambiguously pro-equity, and no market actor will do it unprompted.

Objections, and the Verification Doctrine

Five objections deserve direct answers.

First, hallucination. Models produce confident errors, and the consultant experiment cited above contains the sharpest warning: on tasks deliberately chosen to sit outside the model's competence, AI users performed roughly 19 percentage points worse than unassisted peers.17 The answer is institutional, not technological: treat AI output as junior staff work. No government promulgates a junior analyst's memo unreviewed; none should promulgate a model's. The working elements are grounding in official sources (Buenos Aires' 98.9 percent retrieval accuracy shows what disciplined grounding achieves), mandatory citation, and an accountable human signature on every product. We call this the verification doctrine, and it belongs in the first page of any government AI policy.

Second, the infrastructure objection — the most authoritative version of which comes from the World Bank itself. Its president has publicly doubted that AI can repeat the mobile-money leapfrog, on the grounds that AI demands computing power and electricity that poorer countries lack, and the Bank's 2026 World Development Report warns that AI could widen rather than narrow the gap between rich and poor economies.34 The skepticism is well founded against one version of the thesis — the version in which developing countries build frontier AI. It does not touch the version argued here, which is about using it. Frontier capability is delivered through a browser; the compute burden, and the capital expenditure behind it, sit with the vendor. The region's real disadvantages are also real: it attracts 1.12 percent of global AI investment while producing 6.6 percent of global GDP, and adoption intensity varies enormously — Mexico registers less than half its expected usage.28 But the adoption data cut against infrastructure determinism: Peru, Costa Rica, and Uruguay — none of them compute powers — already use frontier AI more intensively, per capita, than most of the OECD. The divide argues for targeting, not fatalism; and it argues for seats before data centers, not the reverse.

Third, legitimacy. A statute drafted by a model, the objection runs, lacks the authority conferred by deliberative process. The objection misidentifies what is being delegated. Legitimacy attaches to authorization — representation, deliberation, contestation — which remains human throughout. What AI compresses is the production of options and analysis around that process. The deeper point cuts the other way: the same rented bench is equally available to legislatures, audit institutions, opposition parties, and civil society, narrowing the analytical asymmetry that has long favored executives. On the evidence, this technology is a democratizer of analysis, not a technocratic concentrator of it.

Fourth, the fragile genius. A version of this thesis imagines one brilliant official governing alone with a model — a bug, not a feature, in a region where key-person risk is compounded by emigration. The evidence supports a different design: small teams whose junior members are raised toward senior-level output, with prompts, playbooks, and grounding corpora institutionalized so capability survives turnover. There is also a retention dividend: an analyst whose productivity is multiplied at home loses part of the professional rationale for leaving.

Fifth, benchmark skepticism. Some measured language gaps are artifacts of poor test translation, which flatters the pessimistic case; but benchmarks are also translated English tests that cannot measure fluency in, say, Bolivian administrative law, which flatters the optimistic one.32 Both cautions point to the same practice: governments should evaluate models on their own corpus and tasks before deployment, as Brazil's bar-examination studies have begun to do for law.

The Agenda

For governments of the region, the sequence matters more than the spending. Seats before data centers: the fastest returns come from putting frontier tools in the hands of existing analytical staff, not from building sovereign infrastructure first. Evaluate on your own corpus. Adopt the verification doctrine before scale, so that early errors do not discredit the program. Institutionalize the practice — prompt libraries, grounding repositories, documented workflows — so that capability belongs to the ministry, not the individual. And extend the rented bench deliberately to legislatures and supreme audit institutions, where the democratic dividend is largest.

For international funders and development institutions, the highest-value investments are the ones markets will not make: the creole and indigenous language tail; grounding infrastructure — digitized, machine-readable legal codes, gazettes, and statistical archives, without which models cannot be safely anchored to national sources; independent evaluation capacity; and retention of the human talent that directs the work. Capacity-building portfolios built to clone the developed-country bench should be re-examined against the alternative of renting it.

The window is genuinely unusual. Frontier capability in the region's major languages reached near-parity only within the past two years; pricing to governments is collapsing; and the incumbents' lock-in is, for once, a latecomer's advantage. The last technological generation produced Pix, Boti, and a judiciary that works through its backlog. The next can produce something larger: the end of the analytical gap as a defining feature of development — for any government willing to treat intelligence as infrastructure and to keep humans signing.

La brecha de capacidad analítica

Durante el último medio siglo, la ventaja menos reconocida de los gobiernos de los países desarrollados no ha sido la riqueza, la tecnología, ni siquiera las instituciones en abstracto. Ha sido la profundidad de su banca técnica: la capacidad de asignar grandes contingentes de personal especializado, permanente y profesional a cualquier problema analítico que enfrente el Estado. El poder ejecutivo federal de los Estados Unidos emplea aproximadamente 4.440 economistas, 4.750 estadísticos y 68.590 analistas de gestión.1 Su poder legislativo cuenta con el respaldo de la Oficina de Presupuesto del Congreso (CBO, con unos 275 analistas con posgrado), el Servicio de Investigación del Congreso (CRS, con unos 600 funcionarios) y la Oficina de Rendición de Cuentas del Gobierno (GAO, con unos 3.500 funcionarios, cuyo trabajo generó un retorno de 76 dólares por cada dólar invertido en el ejercicio fiscal 2024).2 El Reino Unido opera una Función de Análisis transversal a todo el gobierno con aproximadamente 17.000 analistas, que incluye más de 3.500 economistas en el Government Economic Service — el mayor empleador de economistas del país —, más de 12.000 profesionales de la estadística y una profesión de políticas públicas con cerca de 38.000 servidores civiles.3

Ningún gobierno de América Latina y el Caribe ha podido conformar jamás una banca técnica de esa escala, y la brecha es medible. En el Índice de Desempeño Estadístico del Banco Mundial, el promedio regional es de 66 sobre 100, frente a 93,4 de los Estados Unidos y 88,9 del Reino Unido — con Haití y varios Estados caribeños por debajo de 40.4 El Índice de Desarrollo del Servicio Civil del Banco Interamericano de Desarrollo, que mide el mérito y la capacidad técnica del empleo público en la región, registró un promedio regional inferior a 40 sobre 100 en sus ediciones más recientes.5 En el indicador de Efectividad Gubernamental del Banco Mundial, el promedio regional se ubica cerca de −0,3 en una escala en la que las economías desarrolladas se agrupan en torno a +1,4.6 La mayoría de las legislaturas de la región carece de un equivalente de oficina presupuestaria; Argentina estableció su primera Oficina de Presupuesto del Congreso recién en 2016.

La respuesta convencional — cuatro décadas de asistencia técnica y programas de fortalecimiento institucional orientados a replicar la banca técnica de los países desarrollados mediante capacitación y desarrollo de instituciones — ha producido avances reales pero lentos. Esa banca nunca fue contratable con presupuestos de países en desarrollo: la nómina del gobierno central en la región ya absorbe aproximadamente el 5,8 por ciento del PIB, cerca del 41 por ciento de los ingresos tributarios.5 Entre tanto, las bancas técnicas más profundas del mundo siguen siendo costosas incluso para sus propios dueños. El Reino Unido, con sus 17.000 analistas gubernamentales, gastó una cifra récord de 3.700 millones de libras en consultores externos en el ejercicio 2024/25.7 Incluso los Estados Unidos concluyeron en 1995 que no podían costear la Oficina de Evaluación Tecnológica, cuyos 750 estudios principales habían tomado en promedio dieciocho meses cada uno. El análisis profundo siempre ha sido escaso, en todas partes.

Gráfico 1 · La brecha de capacidad estadística — y su dispersión dentro de la región
Índice de Desempeño Estadístico del Banco Mundial, 2023 (0–100). El promedio de ALC es una media no ponderada de 32 países.
Este documento sostiene que la restricción acaba de desplazarse. Por primera vez, la capacidad analítica de un gobierno de país desarrollado está disponible para cualquier gobierno, en su propio idioma, al precio de un plan de telefonía — y los gobiernos con menos burocracia heredada que defender están en posición de adoptarla más rápido.

El patrón del salto tecnológico

El salto tecnológico (leapfrogging) no es una metáfora; es una regularidad documentada con condiciones conocidas. La literatura económica identifica tres: un cambio de paradigma que colapsa el costo de una capacidad, actores establecidos anclados a inversiones hundidas en la forma antigua de proveerla, y países rezagados con demanda insatisfecha y sin intereses creados que defiendan el statu quo.8 Cuando las tres condiciones se cumplen, los rezagados no convergen gradualmente: se saltan la etapa por completo.

La región y el mundo en desarrollo en general han superado esta prueba repetidamente. África subsahariana nunca construyó telefonía fija — las suscripciones de línea fija alcanzaron un máximo inferior a 1,5 por cada 100 habitantes — y pasó directamente a la telefonía móvil, que subió de 1,7 a 90 suscripciones por cada 100 habitantes entre 2000 y 2023.9 M-Pesa en Kenia llevó la inclusión financiera formal del 27 por ciento a más del 80 por ciento de los adultos en una década, con reducciones medibles de la pobreza.10 India inscribió a más de mil millones de personas en un sistema de identidad biométrica en unos seis años. Y América Latina ha producido saltos propios. Pix, el sistema de pagos instantáneos lanzado por el banco central de Brasil en noviembre de 2020, incorporó al 67 por ciento de los adultos brasileños en catorce meses, procesó 63.400 millones de transacciones en 2024 y dio a unos 50 millones de brasileños su primer pago digital — superando a las tarjetas de crédito y débito combinadas en menos de cuatro años.11 Uruguay ocupa el segundo lugar de las Américas en el Índice de Desarrollo del Gobierno Electrónico de las Naciones Unidas, por delante de Canadá.12 La plataforma gov.br de Brasil registra 166 millones de usuarios.

Gráfico 2 · Pix de Brasil: un salto construido por el Estado a escala nacional
Transacciones Pix por año, en miles de millones. Fuente: Banco Central do Brasil vía BPI / Payments CMI.

Dos casos tempranos de gobernanza sugieren que el patrón ya se está extendiendo al propio Estado analítico. Boti, el asistente de la Ciudad de Buenos Aires basado en WhatsApp, atiende más de tres millones de conversaciones ciudadanas al mes sobre 1.300 trámites municipales, y opera hoy con inteligencia artificial generativa con una precisión de recuperación del 98,9 por ciento contra fuentes oficiales.13 El poder judicial de Brasil, con 76 millones de causas pendientes, ha desplegado más de 140 proyectos de IA desde 2019; los jueces cerraron 75 por ciento más causas en 2024 que en 2020, y el rezago del Supremo Tribunal Federal alcanzó su nivel más bajo desde 1992 — avances que reflejan la IA junto con reformas procesales más amplias, pero que ningún observador considera alcanzables solo mediante contrataciones.14

La tercera condición del salto — el anclaje de los actores establecidos — es visible al otro lado del libro mayor. La Oficina Nacional de Auditoría del Reino Unido constató en 2024 que solo el 37 por ciento de los organismos públicos encuestados había desplegado IA, la mayoría en uno o dos casos de uso, citando brechas de competencias, responsabilidad legal y confiabilidad.15 Un gobierno de país desarrollado debe integrar la IA en una banca de decenas de miles de profesionales asalariados, regímenes de compras públicas y rutinas institucionales. Un ministerio con tres analistas no tiene nada que desplazar.

El doble desbloqueo

Lo que hace categóricamente distinto el momento actual respecto de olas anteriores de "gobierno electrónico" es que la inteligencia artificial elimina dos restricciones simultáneamente: el costo de la especialización y el idioma de la especialización. Cada una por separado sería incremental. Juntas cambian la función de producción del gobernar.

El costo de la especialización

La evidencia de que los grandes modelos de lenguaje comprimen las brechas de destrezas figura hoy entre los hallazgos más replicados de la economía de la IA. En el experimento de campo más grande a la fecha, un asistente de IA elevó la productividad de los agentes de atención al cliente en 14 por ciento en promedio — pero en 34 por ciento para los trabajadores novatos, con efecto mínimo sobre los más experimentados, transmitiendo en la práctica las destrezas tácitas de los mejores al resto.16 Un experimento aleatorizado con 758 consultores encontró mejoras de calidad cercanas al 40 por ciento, concentradas en la mitad inferior de desempeño (+43 por ciento, frente a +17 por ciento en la mitad superior).17 Un estudio controlado de tareas de redacción profesional halló ahorros de tiempo del 40 por ciento, mejoras de calidad del 18 por ciento y — de manera crítica — una compresión de la brecha entre redactores más débiles y más fuertes.18 El patrón es consistente: la IA eleva el piso mucho más que el techo. Los gobiernos de los países desarrollados están restringidos por el techo; la mayoría de los gobiernos de esta región lo está por el piso. Las ganancias relativas fluyen hacia donde la capacidad es escasa.

La aritmética es contundente. Un economista de gobierno de nivel estadounidense cuesta aproximadamente 173.000 dólares al año, con cargas incluidas.1 Una suscripción a una IA de frontera cuesta unos 240 dólares al año — alrededor de 700 puestos por el precio de un economista — y la dirección del cambio apunta hacia cero: en agosto de 2025, la Administración de Servicios Generales de los Estados Unidos negoció el acceso a IA de frontera para todo el gobierno federal a un dólar por año por proveedor.19

Gráfico 3 · La IA eleva el piso: las ganancias se concentran en los menos experimentados
Ganancias de productividad con asistencia de IA, estudios aleatorizados y cuasiexperimentales. Fuentes: Brynjolfsson et al. (QJE 2025); Dell’Acqua et al. (2023).

El idioma de la especialización

El segundo desbloqueo es el que la audiencia de este documento ha vivido en carne propia. La base de conocimiento global se construyó en inglés: aproximadamente la mitad del contenido web medido, cerca del 90 por ciento del texto con el que se entrenaron los primeros grandes modelos y — el dato más revelador — el 98,9 por ciento de los 1.480 millones de citas de la ciencia global remiten a trabajos en inglés.20 Los costos de ese arreglo fueron personales y cuantificables. Los investigadores que trabajan en una segunda lengua reportan necesitar hasta el doble de tiempo para leer y escribir artículos, y enfrentan tasas de rechazo 2,5 veces mayores por razones de idioma.21 En la región, solo Argentina califica "Alto" en el Índice de Dominio del Inglés de EF; Brasil y Colombia califican "Bajo", y México "Muy bajo".22 La élite profesional que podía consultar el conocimiento global con fluidez era, en la práctica, la élite que hablaba inglés.

Gráfico 4 · El muro del idioma tal como existía
Participación del inglés frente a la del español + portugués en la base de conocimiento. Fuentes: W3Techs (2026); estadísticas del corpus de GPT-3, OpenAI (2020); Pradier et al., JASIST (2026).

Esa barrera se ha disuelto sustancialmente para los dos idiomas mayoritarios de la región. En evaluaciones traducidas profesionalmente, Claude Sonnet 4.5 rinde al 98,2 por ciento de su nivel en inglés cuando opera en español y al 97,8 por ciento en portugués de Brasil; en algunos benchmarks de 2025, los modelos de frontera puntúan igual o mejor en español que en inglés.23 La capacidad es de grado profesional, no conversacional: Claude 3.5 Sonnet aprobó las veintiún ediciones del examen escrito de redacción jurídica del colegio de abogados de Brasil (OAB) en portugués, con un promedio superior al de modelos especializados específicamente en ese idioma.24 La investigación en interpretabilidad indica por qué: los grandes modelos procesan crecientemente el significado en un espacio conceptual agnóstico al idioma, de modo que el conocimiento absorbido en inglés se vuelve accesible desde una consulta en español o portugués.25 La brecha residual es económica antes que cognitiva — el español y el portugués consumen aproximadamente un tercio más de tokens por palabra, una prima de costo modesta que ha caído con cada generación de tokenizadores.26

Gráfico 5 · El muro se disuelve: desempeño de los modelos de frontera por idioma
Claude Sonnet 4.5, MMLU traducido por profesionales, relativo al inglés = 100%. Fuente: Anthropic (2025). En naranja: los dos idiomas mayoritarios de la región.

El efecto combinado ya es medible allí donde la adopción está más avanzada. Un análisis de más de dos millones de artículos biomédicos encontró que la escritura asistida por IA creció cerca de 400 por ciento en los países no angloparlantes — frente a 183 por ciento en los angloparlantes — y que una mayor adopción de IA redujo la brecha de publicación entre unos y otros.27 Lo que está documentado para la ciencia es el argumento de este documento para el gobierno: una dirección de presupuesto puede hoy consultar, en español, el mismo corpus global que un analista de Washington o Whitehall consulta en inglés, y producir trabajo técnico de factura comparable.

Empleamos el término vibe governing — tomado, deliberadamente, del "vibe coding", que trasladó la producción de software de los especialistas a cualquiera capaz de describir una intención — para la versión seria de esta práctica: la delegación iterativa, en lenguaje natural, de la producción analítica a sistemas de IA, con la dirección, el juicio y la rendición de cuentas retenidos por funcionarios humanos. El término merece un momento de franqueza, porque no entró al léxico como un elogio. Fue acuñado en abril de 2025, cuando varios analistas observaron que una fórmula arancelaria estadounidense se asemejaba estrechamente a lo que producen los chatbots cuando se les pregunta por déficits comerciales, y "vibe governing" pasó a significar preguntarle a un modelo qué hacer y ejecutar la respuesta sin examinarla.33 El detalle más instructivo del episodio suele omitirse: los modelos habían acompañado sus respuestas con salvedades sustantivas, y los decisores las ignoraron. Eso no es un argumento contra gobernar con IA; es un argumento contra gobernar sin verificación — una falla de proceso al alcance de cualquier gobierno, con o sin modelo. Este documento defiende la versión disciplinada. Lo que se delega es la producción: redacción, modelación, traducción, revisión estadística, investigación jurídica comparada. Lo que nunca se delega es la autorización: la elección de objetivos, la validación de los productos y la firma.

La adopción no es hipotética. En el índice de Anthropic de uso per cápita de Claude, Perú (1,19), Costa Rica (1,12), Uruguay (1,10) y Chile (1,04) ya superan las expectativas globales para su población en edad de trabajar, y la región ocupa el tercer lugar mundial en descargas de aplicaciones de IA generativa.28
Gráfico 6 · Intensidad de adopción en la región
Uso de Claude relativo a la población en edad de trabajar; 1,0 = expectativa global. En naranja: por encima de la expectativa. Fuente: Anthropic Economic Index (2025).

La prueba del Caribe

Una versión honesta de este argumento debe declarar con claridad dónde el desbloqueo lingüístico aún no ha llegado. La casi paridad documentada arriba pertenece al español y al portugués — idiomas con cientos de millones de hablantes y corpus digitales profundos. No se extiende todavía a las lenguas criollas del Caribe ni a las lenguas indígenas de la región. El creole haitiano, idioma cotidiano de más de diez millones de personas, está representado en los corpus de investigación en cientos de miles de palabras; el desempeño de los modelos de frontera cae entre 20 y 40 puntos en lenguas genuinamente de bajos recursos, y la cobertura de traducción automática de los criollos caribeños sigue siendo mínima.29 El quechua, el guaraní y el aimara no corren mejor suerte.

Para el Caribe anglófono el salto está disponible de inmediato — en inglés, con la ventaja adicional de que esos Estados figuran entre los más restringidos del mundo por la emigración: más del 70 por ciento de la fuerza laboral con educación terciaria del Estado caribeño promedio ha emigrado, cifra que asciende al 89 por ciento en Guyana.30 Donde la banca técnica no puede retenerse, alquilarla importa más. Pero para Haití y para la gobernanza en lenguas indígenas, el desbloqueo debe construirse. Los esfuerzos regionales han comenzado — el consorcio Latam-GPT liderado desde Chile abarca quince países y ha iniciado trabajo en lenguas indígenas, y programas de investigación abierta han reunido millones de pares de oraciones en lenguas criollas31 — pero sus presupuestos son marginales frente a los laboratorios de frontera. Cerrar la cola lingüística es la inversión en bienes públicos más clara que ofrece esta agenda a los financiadores internacionales: es barata para los estándares de la industria de la IA, es inequívocamente pro-equidad, y ningún actor de mercado la hará por iniciativa propia.

Objeciones y la doctrina de verificación

Cinco objeciones merecen respuestas directas.

Primera, la alucinación. Los modelos producen errores con apariencia de certeza, y el experimento con consultores citado arriba contiene la advertencia más aguda: en tareas deliberadamente elegidas fuera de la frontera de competencia del modelo, los usuarios de IA rindieron aproximadamente 19 puntos porcentuales peor que sus pares sin asistencia.17 La respuesta es institucional, no tecnológica: tratar el producto de la IA como trabajo técnico de nivel junior. Ningún gobierno promulga sin revisión el memorando de un analista junior; ninguno debería promulgar el de un modelo. Los elementos operativos son el anclaje en fuentes oficiales (la precisión de recuperación del 98,9 por ciento de Boti muestra lo que logra un anclaje disciplinado), la citación obligatoria y la firma de un funcionario responsable en cada producto. Llamamos a esto la doctrina de verificación, y pertenece a la primera página de cualquier política gubernamental de IA.

Segunda, la objeción de infraestructura — cuya versión más autorizada proviene del propio Banco Mundial. Su presidente ha expresado públicamente dudas de que la IA pueda repetir el salto del dinero móvil, con el argumento de que la IA exige capacidad de cómputo y electricidad de las que carecen los países más pobres, y el Informe sobre el Desarrollo Mundial 2026 del Banco advierte que la IA podría ampliar, en lugar de reducir, la brecha entre economías ricas y pobres.34 El escepticismo está bien fundado contra una versión de la tesis — aquella en la que los países en desarrollo construyen IA de frontera. No toca la versión que aquí se defiende, que trata de usarla. La capacidad de frontera se entrega a través del navegador; la carga de cómputo, y el gasto de capital que la respalda, recaen en el proveedor. Las desventajas reales de la región también son reales: atrae el 1,12 por ciento de la inversión global en IA mientras produce el 6,6 por ciento del PIB mundial, y la intensidad de adopción varía enormemente — México registra menos de la mitad de su uso esperado.28 Pero los datos de adopción desmienten el determinismo de infraestructura: Perú, Costa Rica y Uruguay — ninguno potencia de cómputo — ya usan la IA de frontera con mayor intensidad per cápita que la mayoría de la OCDE. La brecha digital exige focalización, no fatalismo; y exige puestos antes que centros de datos, no lo contrario.

Tercera, la legitimidad. Un estatuto redactado por un modelo, sostiene la objeción, carece de la autoridad que confiere el proceso deliberativo. La objeción identifica mal lo que se delega. La legitimidad se adhiere a la autorización — representación, deliberación, contestación — que permanece humana en todo momento. Lo que la IA comprime es la producción de opciones y análisis alrededor de ese proceso. El punto más profundo corta en el sentido contrario: la misma banca alquilada está igualmente disponible para legislaturas, entidades fiscalizadoras superiores, partidos de oposición y sociedad civil, reduciendo la asimetría analítica que históricamente ha favorecido a los ejecutivos. Según la evidencia, esta tecnología es una democratizadora del análisis, no una concentradora tecnocrática.

Cuarta, el genio frágil. Una versión de esta tesis imagina a un funcionario brillante gobernando solo con un modelo — un defecto, no una virtud, en una región donde el riesgo de dependencia de personas clave se agrava con la emigración. La evidencia respalda un diseño distinto: equipos pequeños cuyos integrantes junior son elevados hacia productos de nivel senior, con prompts, manuales operativos y corpus de anclaje institucionalizados para que la capacidad sobreviva a la rotación. Hay además un dividendo de retención: un analista cuya productividad se multiplica en su país pierde parte de la razón profesional para irse.

Quinta, el escepticismo sobre los benchmarks. Algunas brechas de idioma medidas son artefactos de malas traducciones de prueba, lo que favorece al caso pesimista; pero los benchmarks son también exámenes en inglés traducidos, incapaces de medir la fluidez en, digamos, derecho administrativo boliviano, lo que favorece al optimista.32 Ambas cautelas apuntan a la misma práctica: los gobiernos deben evaluar los modelos sobre su propio corpus y sus propias tareas antes del despliegue, como los estudios del examen de la OAB brasileña han comenzado a hacer para el derecho.

La agenda

Para los gobiernos de la región, la secuencia importa más que el gasto. Puestos antes que centros de datos: los retornos más rápidos provienen de poner las herramientas de frontera en manos del personal analítico existente, no de construir primero infraestructura soberana. Evaluar sobre el corpus propio. Adoptar la doctrina de verificación antes de escalar, para que los errores tempranos no desacrediten el programa. Institucionalizar la práctica — bibliotecas de prompts, repositorios de anclaje, flujos de trabajo documentados — para que la capacidad pertenezca al ministerio y no al individuo. Y extender deliberadamente la banca alquilada a las legislaturas y a las entidades fiscalizadoras superiores, donde el dividendo democrático es mayor.

Para los financiadores internacionales y las instituciones de desarrollo, las inversiones de mayor valor son las que los mercados no harán: la cola lingüística criolla e indígena; la infraestructura de anclaje — códigos legales, gacetas oficiales y archivos estadísticos digitalizados y legibles por máquina, sin los cuales los modelos no pueden anclarse con seguridad a las fuentes nacionales; la capacidad independiente de evaluación; y la retención del talento humano que dirige el trabajo. Los portafolios de fortalecimiento institucional concebidos para clonar la banca técnica de los países desarrollados deberían reexaminarse frente a la alternativa de alquilarla.

La ventana es genuinamente inusual. La capacidad de frontera en los idiomas mayoritarios de la región alcanzó la casi paridad hace apenas dos años; los precios para los gobiernos están colapsando; y el anclaje de los actores establecidos es, por una vez, una ventaja para los rezagados. La última generación tecnológica produjo Pix, Boti y un poder judicial que avanza sobre su rezago. La próxima puede producir algo mayor: el fin de la brecha analítica como rasgo definitorio del desarrollo — para cualquier gobierno dispuesto a tratar la inteligencia como infraestructura y a mantener la firma en manos humanas.

SourcesFuentes

  1. US Bureau of Labor Statistics, Occupational Employment and Wage Statistics, Federal Executive Branch (NAICS 999100), May 2022. — fully loaded cost estimate assumes ~30% benefits load on the $133,220 mean economist wage.
  2. Congressional Budget Office, Organization and Staffing. · US Government Accountability Office, FY2024 results.
  3. UK Government Analysis Function, About the Analysis Function; Government Economic Service. · https://analysisfunction.civilservice.gov.uk/government-economic-service · UK Civil Service Statistics 2026.
  4. World Bank, Statistical Performance Indicators, 2023. — regional average is an unweighted mean of 32 countries.
  5. Inter-American Development Bank, Civil Service Development Index; Better Governments for Better Lives (2025). · payroll figures from IDB (2014).
  6. World Bank, Worldwide Governance Indicators.
  7. Tussell / Consultancy.uk, UK government consulting spend, FY2024/25.
  8. Lee, K., The Economics of Technological Leapfrogging, UNIDO Working Paper 17/2019.
  9. World Bank / ITU data via Our World in Data, "Many countries are leapfrogging landlines.".
  10. Suri, T. and Jack, W., "The long-run poverty and gender impacts of mobile money," Science, 2016.
  11. BIS Bulletin No. 52 (2022). · Banco Central do Brasil data via Payments CMI.
  12. UN E-Government Survey 2024, via Uruguay XXI.
  13. AWS case study, Buenos Aires "Boti" on Amazon Bedrock, 2025.
  14. Rest of World, "Brazil's courts embrace AI," 2025.
  15. UK National Audit Office, Use of AI in Government, March 2024.
  16. Brynjolfsson, E., Li, D., and Raymond, L., "Generative AI at Work," Quarterly Journal of Economics 140(2), 2025.
  17. Dell'Acqua, F. et al., "Navigating the Jagged Technological Frontier," Harvard Business School Working Paper, 2023.
  18. Noy, S. and Zhang, W., "Experimental evidence on the productivity effects of generative artificial intelligence," Science, 2023.
  19. US General Services Administration, OneGov agreements, August 2025.
  20. W3Techs, Usage statistics of content languages for websites (August 2026). · OpenAI, GPT-3 dataset statistics. · Pradier, Céspedes and Larivière, JASIST, 2026.
  21. Amano, T. et al., "The manifold costs of being a non-native English speaker in science," PLOS Biology, 2023.
  22. EF Education First, English Proficiency Index 2025.
  23. Anthropic, Claude multilingual support documentation (accessed August 2026). · MMLU-ProX, EMNLP 2025.
  24. Pires, R. et al., "Automatic legal writing evaluation of LLMs" (Brazilian OAB exams), 2025.
  25. Anthropic, "Tracing the thoughts of a large language model," 2025.
  26. Petrov, A. et al., "Language Model Tokenizers Introduce Unfairness Between Languages," NeurIPS 2023.
  27. "AI-Assisted Writing Is Growing Fastest Among Non-English-Speaking and Less Established Scientists," 2025.
  28. Anthropic Economic Index, geography of AI adoption, 2025. · ILIA 2025, CENIA/ECLAC.
  29. Belebele benchmark (Meta, 2023). · Kreyòl-MT, 2024.
  30. Mishra, P., "Emigration and Brain Drain: Evidence from the Caribbean," IMF Working Paper 06/25, 2006.
  31. Latam-GPT / CENIA, 2026 coverage: Brookings.
  32. "Is MMLU Lost in Translation?", 2024. · Global-MMLU (Cohere), 2024.
  33. Krishnan, R., "Vibe Governing," Strange Loop Canon, April 7, 2025.
  34. GovInsider, "Everyone is betting on leapfrogging AI. The World Bank President doesn't believe it," 2026. — see also World Bank, World Development Report 2026.