La revolución de la IA está optimizando para las cosas equivocadas.

La revolución de la IA está optimizando para las cosas equivocadas.

      TL;DRLos modelos de IA de frontera están mejorando en codificación y tareas agenciales, pero empeorando en escritura general. El fundador de Wizard Labs, Maz Ahmadi, informa de una regresión medible en los estándares de prosa específicos del cliente a través de las actualizaciones del modelo. Con el 44% de las organizaciones escalando la IA a nivel empresarial, pero solo el 37% viendo impacto en EBIT (McKinsey), la brecha entre la implementación y el valor se está ampliando. Su receta: construir suites de evaluación personalizadas antes de que comience el desarrollo y dejar de seleccionar modelos basados en estándares públicos.

      Cada modelo de lenguaje grande existente hoy en día está empeorando en escritura, y casi nadie lo está midiendo.

      La industria sigue preguntando cuál modelo es el más inteligente, pero la pregunta más grande es: ¿inteligente en qué?

      A medida que los gigantes tecnológicos persiguen contratos empresariales lucrativos, están optimizando modelos de frontera para codificación, lógica y flujos de trabajo de agentes autónomos. En el proceso, la prosa general se ha convertido en un pensamiento secundario. En nuestros estándares específicos del cliente, mi equipo notó una regresión que debería alarmar a cualquiera que use IA para la comunicación. A medida que los modelos se actualizan, su rendimiento en escritura está disminuyendo activamente.

      Eso puede sonar como un problema esotérico para ingenieros y equipos de contenido. No lo es. La IA ahora está presente en el trabajo diario de millones de personas. Casi nueve de cada diez empresas ahora utilizan IA regularmente en una función empresarial: redactar informes, responder a clientes, preparar documentos legales, escribir código, analizar investigaciones y tomar decisiones. Si los modelos subyacentes se están optimizando para una definición diferente de rendimiento, todos heredan las consecuencias.

      El último debate sobre la marca de agua en textos de IA hace esto aún más interesante.

      Anthropic anunció este mes que los futuros modelos Claude marcarán con agua el texto generado para cumplir con la Ley de IA de la UE. La técnica utiliza patrones estadísticos en la selección de tokens para que el texto generado pueda ser identificado más tarde como probablemente involucrando a Claude. Anthropic insiste en que su método no tiene efecto práctico en calidad, creatividad o legibilidad, y señala la investigación detrás del enfoque.

      Aun así, los usuarios empresariales deberían preguntarse qué sucede cuando un modelo se está optimizando simultáneamente en torno a requisitos regulatorios, rendimiento agencial, codificación y razonamiento.

      Ya he visto evidencia en nuestro propio trabajo de que las actualizaciones de modelos pueden producir peores resultados para tareas de escritura específicas. La marca de agua puede resultar inofensiva en aislamiento; no afirmaría lo contrario. Pero la tendencia más amplia merece un examen. Si los laboratorios de frontera se optimizan en torno a los estándares que impulsan la adopción y los ingresos, un modelo puede volverse objetivamente mejor mientras se vuelve peor para un negocio particular.

      Ese es el paradoja que las empresas están comenzando a encontrar.

      El 44% de las organizaciones ahora informa que la IA se está escalando en toda la empresa, un aumento del 38% en un año. Sin embargo, solo el 37% informa algún impacto en EBIT a nivel empresarial por parte de la IA, mientras que el 80% dice que la IA ha mejorado la productividad individual.

      La tecnología se está extendiendo más rápido que el valor. Veo el mismo error repetidamente. Una empresa pregunta: “¿Cuál es el mejor modelo?” Selecciona el modelo que domina los estándares públicos, construye un sistema en torno a él y espera que el proyecto se comporte como un desarrollo de software convencional.

      La IA no funciona de esa manera.

      Un modelo que es el mejor modelo de lenguaje grande generalizado puede ser mediocre en el flujo de trabajo particular de una empresa. La única prueba significativa es la tarea en sí. Eso significa desarrollar suites de evaluación personalizadas antes de que comience el desarrollo, medir los modelos contra los requisitos reales de la empresa y luego probar continuamente esos resultados a medida que los modelos cambian.

      Aquí es donde la IA empresarial necesita una nueva disciplina. Comience con el problema empresarial, pruebe la tecnología contra el rendimiento del mundo real y siga refinándola hasta que la economía y el flujo de trabajo tengan sentido, asegurándose de que la tecnología apoye la forma en que realmente funciona el negocio antes de que se escale en toda la organización.

      Un futuro más fuerte puede existir, donde las empresas construyan IA en torno a sus datos y experticia propietarios, dando a los empleados sistemas de apoyo a la decisión que pueden extender el conocimiento especializado en toda la organización. El peligro radica en entregar el juicio crítico a sistemas genéricos, tratando las puntuaciones de referencia como prueba de competencia y descubriendo demasiado tarde que la tecnología fue optimizada para la definición de éxito de otra persona.

      Creo que el primer futuro pertenece a las empresas dispuestas a cuestionar los valores predeterminados.

      Eso también puede significar reconsiderar la suposición de que cada empresa debería depender del modelo propietario más grande. Los modelos de peso abierto están volviéndose cada vez más capaces, y pueden ser alojados dentro de la infraestructura elegida por una organización. La pregunta que escucho de las empresas sobre si los modelos desarrollados en China son inherentemente inseguros a menudo se enmarca como una cuestión geopolítica. Técnicamente, la pregunta más importante es dónde se ejecuta el modelo, quién controla la infraestructura, qué datos salen del entorno y qué arquitectura de seguridad lo rodea.

      La ventaja competitiva vendrá de tomar esas decisiones de manera intencionada.

      La naturaleza de la revolución de la IA ha cambiado de una carrera por la inteligencia bruta a una disciplina de ajuste de ingeniería. Los futuros líderes del mercado no ganarán simplemente desplegando los últimos modelos fundamentales. En cambio, el éxito favorecerá a las organizaciones que definan necesidades operativas precisas, impongan estándares rigurosos y mantengan la claridad estratégica para reemplazar un modelo sobrevalorado y celebrado cuando una alternativa menos glamorosa ofrezca resultados superiores.

      Los ejecutivos deberían dejar de preguntar a sus proveedores de IA cuál modelo es el mejor. Deberían pedirles que demuestren cuál modelo es el mejor para su negocio. Ese único cambio convertiría la IA de un ejercicio de adquisición de tecnología en lo que realmente es: una prueba a largo plazo de supervivencia competitiva.

Otros artículos

Se informa que Nvidia está en conversaciones para comprar Hugging Face por 12.9 mil millones de dólares. Se informa que Nvidia está en conversaciones para comprar Hugging Face por 12.9 mil millones de dólares. Nvidia ha estado en conversaciones para adquirir Hugging Face a una valoración superior a los 13 mil millones de dólares, tres años después de que el hub de modelos abiertos rechazara su inversión. La próxima frontera en fintech es entender a la persona detrás de los datos. La próxima frontera en fintech es entender a la persona detrás de los datos. El fundador de Neumetria, Amr Mohamed, argumenta que el fintech necesita una capa de comprensión del comportamiento que interprete por qué ocurren las transacciones, no solo qué son. Con los agentes de IA acercándose a los sistemas financieros, el contexto se convierte en infraestructura. Samsung construyó un monitor de juegos de 1,100Hz porque aparentemente 600Hz no era lo suficientemente rápido. Samsung construyó un monitor de juegos de 1,100Hz porque aparentemente 600Hz no era lo suficientemente rápido. El nuevo monitor de juegos Odyssey G6 de Samsung puede alcanzar 1,100Hz en resolución HD, ligeramente por encima de su máximo previamente anunciado de 1,040Hz, mientras que su modo QHD de 600Hz puede resultar más práctico. Perion adquiere PRN por hasta 12 millones de dólares, ampliando el alcance de los medios minoristas en tienda en toda América del Norte. Perion adquiere PRN por hasta 12 millones de dólares, ampliando el alcance de los medios minoristas en tienda en toda América del Norte. Perion adquiere la empresa de medios minoristas en tienda PRN por hasta $12 millones, obteniendo inventario exclusivo en más de 7,450 ubicaciones minoristas y de atención médica. El acuerdo conecta campañas digitales con el punto de compra físico. El asistente ejecutivo del futuro: el enfoque de DonnaPro sobre la colaboración entre humanos e IA El asistente ejecutivo del futuro: el enfoque de DonnaPro sobre la colaboración entre humanos e IA DonnaPro capacita a asistentes ejecutivos en herramientas de IA antes de que comiencen, y luego los respalda con 2,500 páginas de marcos. El fundador Filip Pesek argumenta que las mejores herramientas de IA aún necesitan a un humano que sepa cómo pensar. El asistente ejecutivo del futuro: el enfoque de DonnaPro sobre la colaboración entre humanos e IA El asistente ejecutivo del futuro: el enfoque de DonnaPro sobre la colaboración entre humanos e IA DonnaPro capacita a asistentes ejecutivos en herramientas de IA antes de que comiencen, y luego los respalda con 2,500 páginas de marcos. El fundador Filip Pesek argumenta que las mejores herramientas de IA aún necesitan a un humano que sepa cómo pensar.

La revolución de la IA está optimizando para las cosas equivocadas.

A medida que los laboratorios fronterizos se optimizan para la codificación y los agentes, la calidad de la prosa general está disminuyendo. Maz Ahmadi, fundador de Wizard Labs, argumenta que las empresas deberían dejar de preguntar cuál es el mejor modelo y comenzar a demostrar cuál es el mejor para su negocio.