Hiperparâmetros de Ajuste na IA Generativa
meta.llama-3.3-70b-instruct é o modelo base pré-treinado atualmente disponível para ajuste fino na OCI Generative AI. Esta página lista seus hiperparâmetros suportados, intervalos válidos e valores padrão.
Observação
A variante padrão do
A variante padrão do
meta.llama-3.3-70b-instruct está disponível para ajuste fino. A variante meta.llama-3.3-70b-instruct-fp8-dynamic não está disponível para ajuste fino. Consulte Meta Llama 3.3 (70B) e Modelos por Região.Antes de ajustar, revise os requisitos de dados de treinamento. Para obter informações sobre o processo completo, consulte Workflow Ajustando.
Dica
Inicie o ajuste fino com os valores de hiperparâmetro padrão. Após a criação do modelo personalizado, na página de detalhes do modelo, em Desempenho do Modelo, revise os valores para precisão e perda. Se os resultados não atenderem às suas necessidades, crie outro modelo personalizado com um conjunto de dados maior ou diferentes hiperparâmetros.
Inicie o ajuste fino com os valores de hiperparâmetro padrão. Após a criação do modelo personalizado, na página de detalhes do modelo, em Desempenho do Modelo, revise os valores para precisão e perda. Se os resultados não atenderem às suas necessidades, crie outro modelo personalizado com um conjunto de dados maior ou diferentes hiperparâmetros.
meta.llama-3.3-70b-instruct
A tabela a seguir descreve os hiperparâmetros que o OCI Generative AI usa para treinar um modelo base meta.llama-3.3-70b-instruct com o método LoRA.
| Hiperparâmetro | Descrição | Intervalo Válido | Valor Padrão |
|---|---|---|---|
| Total de épocas de treinamento | O número de vezes que o treinamento itera em todo o conjunto de dados de treinamento. Por exemplo, 1 epoch significa que o modelo é treinado usando todo o conjunto de dados de treinamento uma vez. |
1 ou um número inteiro superior |
3 |
| Taxa de aprendizado | A velocidade na qual os pesos do modelo são atualizados em relação ao gradiente de erro. | Um número entre 0 e 1.0 | 0 |
| Tamanho do batch de treinamento | O número de amostras em um minibatch a serem analisadas antes de atualizar os parâmetros do modelo. | Um número inteiro entre 8 e 16 | 8 |
| paciência de interrupção antecipada | Define o número de períodos de tolerância para continuar o ciclo de avaliação, após o acionamento do limite de interrupção antecipada. O treinamento será interrompido se a métrica de perda não melhorar além do limite de interrupção antecipada para muitas vezes a avaliação. | 0 para desativar e 1 ou um inteiro maior para adicionar um período de tolerância | 15 |
| Limite de interrupção antecipada | A perda melhora quando diminui no próximo ciclo de treinamento. Se a perda não melhorar o suficiente, você pode parar o treinamento. Defina a melhoria mínima de perda de avaliação que deve acionar o contador de parada antecipada. Se a perda não melhorar além do valor mínimo durante o período de paciência, o treinamento para. Caso contrário, o treinamento continua e o contador é redefinido. | 0 ou um número positivo | 0 |
| Intervalo de métricas do modelo de log em etapas | O número de etapas por log. Métricas de modelo, como perda de treinamento e taxa de aprendizado, são registradas. Se a perda do treinamento não estiver diminuindo conforme esperado, analise os dados do treinamento ou o índice de aprendizado. | Predefinir para 10 | 10 |
LoRA r (somente para o método LoRA) |
A dimensão atenção (classificação) das matrizes de atualização. Uma classificação inferior resulta em matrizes de atualização menores com menos parâmetros treináveis. | Um número inteiro entre 1 e 64 | 8 |
LoRA alpha (somente para o método LoRA) |
O parâmetro alpha para dimensionamento de LoRA. As matrizes de peso LoRA são escalonadas dividindo LoRA alfa por LoRA r. O parâmetro alpha define os pesos LoRA, que são um número menor de novos pesos e são os únicos que são treinados no modelo. |
Um número inteiro entre 1 e 128 | 8 |
LoRA dropout (somente para o método LoRA) |
A probabilidade de abandono de neurônios nas camadas LoRA. O método evita o overfitting ignorando aleatoriamente (descartando) os neurônios dentro de uma camada. Uma queda de 10% significa que cada neurônio tem uma chance de 10% de cair. |
Um número decimal menor que 1 para porcentagem, como 0,1 para 10% | 0,1 |
A equação a seguir mostra como o modelo calcula o parâmetro
totalTrainingSteps.totalTrainingSteps = (totalTrainingEpochs * size(trainingDataset)) / trainingBatchSizeNa equação anterior, o modelo ignora alguns cálculos de arredondamento.