← Volver a FAQ IA

Podo adestrar unha IA cos datos da miña empresa?

Daniel García·

Un cliente que vende maquinaria industrial de segunda man preguntounos hai un par de meses se podiamos “adestrar unha IA” cos quince anos de correos e orzamentos que tiñan gardados nun servidor. Quería un asistente que respondese dúbidas técnicas dos seus comerciais usando ese histórico. Díxenlle que si se podía facer algo parecido, pero que “adestrar” non era a palabra correcta, e que se alguén lle ofrece “imos adestrar o teu propio modelo” por dous mil euros, que desconfíe.

Adestrar un modelo desde cero, ou mesmo facer fine-tuning sobre un xa existente, require moitos máis datos dos que ten unha pequena empresa normal, e ademais o resultado non adoita ser mellor có da alternativa máis barata: darlle ao modelo acceso aos teus documentos no momento da pregunta, en vez de tentar que os aprenda de memoria. Iso chámase RAG (retrieval-augmented generation), e é o que case sempre monta calquera axencia cando fala de “IA cos datos da túa empresa”, aínda que non sempre o diga con ese nome.

A diferenza práctica é esta: co fine-tuning modificas os pesos do modelo, precisas GPU, tempo de adestramento, e cada vez que cambian os teus datos tes que volver adestralo. Con RAG gardas os teus documentos trozados nunha base de datos vectorial, e cando alguén pregunta algo, o sistema busca os fragmentos máis relevantes e pásallos ao modelo como contexto antes de que responda. Engadir un orzamento novo é literalmente subir un ficheiro. Non hai readestramento nin factura de GPU.

Co cliente da maquinaria montamos exactamente iso: os correos e orzamentos trozados e metidos nunha base vectorial (usamos pgvector porque xa tiñan Postgres, non facía falta meter unha ferramenta nova no stack), e un asistente interno que un comercial usa para preguntar “que lle orzamentamos a tal cliente por unha carretilla de tal modelo en 2024?” e devólvelle o documento relevante coa resposta xa resumida. Custou unha fracción do que tería custado o fine-tuning, e púxémolo en produción en dúas semanas.

Hai un caso no que si ten sentido o fine-tuning: cando precisas que o modelo responda sempre cun formato ou un ton moi específico e RAG non abonda para forzalo (por exemplo, xerar código nun estilo interno moi particular a partir de miles de exemplos xa escritos). Pero iso é raro no traballo que facemos con clientes de axencia pequena, e cando apareceu foi case sempre para un caso moi concreto de xeración de contido, non para “responder preguntas sobre os meus datos”.

O que máis me molesta deste tema é a cantidade de propostas que vin circular ofrecendo “adestrar a túa IA personalizada” cando en realidade é un RAG con catro liñas de código arredor. Non é mentira exactamente, pero infla o prezo e dá a entender que fai falta moita máis infraestrutura da que fai falta de verdade. Se cho ofrecen así, pregunta directamente se é fine-tuning ou RAG: coa resposta xa sabes bastante rápido se quen cho vende sabe o que fai.

iaragadestramento