Quels sont les LLM non censurés ?
Les LLM non censurés sont des modèles de langage à poids ouverts qui ont été modifiés pour réduire certains des comportements de refus observés dans les assistants IA standards. Ils offrent à l'utilisateur un contrôle accru sur le comportement du modèle, ce qui les rend particulièrement pertinents pour ceux qui exécutent et expérimentent avec des LLM localement.
Que sont les LLM non censurés ?
La plupart des assistants IA modernes sont entraînés à respecter des règles de sécurité et à refuser certaines demandes. Ce comportement peut découler de l'ajustement d'instructions, de l'entraînement préférentiel, des invites système et d'autres éléments du modèle ou de l'application.
Un LLM non censuré est généralement un modèle qui a été modifié ou entraîné pour atténuer certains de ces comportements de refus. Il n'existe pas de définition technique unique de « non censuré ». Les créateurs de différents modèles peuvent utiliser des méthodes distinctes, et les modèles résultants peuvent se comporter très différemment.
Certains modèles non censurés sont créés par un affinage supplémentaire (fine-tuning). D'autres utilisent des techniques qui modifient des comportements spécifiques dans un modèle existant. Le terme peut également désigner des modèles décrits comme abliterés (abliterated), bien que l'abliteration soit une technique spécifique plutôt qu'un synonyme de tous les modèles non censurés.
Non censuré ne signifie pas sans restriction
Supprimer ou réduire le comportement de refus ne rend pas un modèle plus capable. Un modèle non censuré peut toujours produire des informations incorrectes, mal interpréter des instructions ou refuser certaines demandes.
- La capacité compte toujours : Un modèle plus petit ne deviendra pas un meilleur raisonneur simplement parce que son comportement de refus a été modifié.
- La qualité varie : Les modèles non censurés peuvent présenter des différences significatives selon leur modèle de base et la manière dont ils ont été modifiés.
- Le comportement n'est pas garanti : Un modèle non censuré peut toujours refuser certaines demandes ou suivre les instructions de manière incohérente.
- Le comportement de sécurité peut changer : La réduction des refus peut également supprimer certaines mesures de sécurité qui faisaient partie de l'entraînement du modèle d'origine.
Il est donc plus utile de considérer « non censuré » comme une description du comportement d'un modèle, plutôt que comme une garantie de ce que le modèle peut faire.
Non censuré vs Poids ouverts vs Modèles de base
Ces termes sont souvent utilisés ensemble, mais ils décrivent des aspects différents d'un LLM.
| Terme | Signification |
|---|---|
| Poids ouverts (Open-weight) | Les poids du modèle sont disponibles pour le téléchargement et l'exécution. |
| Modèle de base | Le modèle sous-jacent avant tout ajustement d'instructions ou comportemental supplémentaire. |
| Affinage (Fine-tune) | Un modèle qui a été davantage entraîné sur un jeu de données ou un objectif particulier. |
| Modèle non censuré | Un modèle modifié ou entraîné pour réduire certains comportements de refus. |
| Modèle abliteré | Un modèle modifié à l'aide d'une technique d'abliteration pour réduire un comportement de refus spécifique. |
Ces catégories peuvent se chevaucher. Un modèle non censuré peut être à poids ouverts et basé sur un modèle existant. Il peut aussi s'agir d'un affinement ou d'une autre modification de ce modèle. L'étiquette seule ne permet pas de comprendre exactement comment le modèle a été créé.
Pourquoi exécuter un LLM non censuré localement ?
L'exécution locale d'un LLM non censuré offre à l'utilisateur un contrôle accru sur le modèle et son environnement. Au lieu de s'appuyer sur un service d'IA hébergé, le modèle s'exécute sur un matériel contrôlé par l'utilisateur.
- Contrôle : Vous choisissez le modèle, le logiciel d'inférence et la configuration.
- Confidentialité : Les invites et les réponses générées peuvent rester dans votre propre environnement de calcul.
- Personnalisation : Les modèles à poids ouverts peuvent être modifiés, affinés et configurés pour différentes charges de travail.
- Utilisation hors ligne : Un modèle hébergé localement n'a pas besoin d'envoyer les invites à un service d'IA externe.
- Expérimentation : Les développeurs et les chercheurs peuvent comparer différentes versions de modèles et modifications.
L'inférence locale vous offre également un contrôle sur le matériel exécutant le modèle. Cela devient important à mesure que la taille des modèles augmente.
Quel matériel les LLM non censurés nécessitent-ils ?
Les modèles non censurés ont généralement les mêmes exigences matérielles que le modèle sous-jacent sur lequel ils sont basés. Les principaux facteurs sont la taille du modèle, la quantification, la longueur du contexte et les paramètres d'inférence.
Un modèle plus grand nécessite plus de mémoire qu'un modèle plus petit. La quantification peut réduire la mémoire requise pour charger un modèle, rendant les modèles plus grands réalisables sur des GPU avec moins de VRAM.
La VRAM est également utilisée par le processus d'inférence lui-même. Le cache KV et d'autres données d'exécution nécessitent une mémoire supplémentaire, et des fenêtres de contexte plus longues peuvent augmenter la quantité de mémoire nécessaire.
Cela signifie que le choix d'un modèle n'est qu'une partie de la planification d'une configuration LLM locale. Le GPU doit disposer d'une VRAM disponible suffisante pour le modèle et la charge de travail que vous comptez exécuter.
Essayer sur DaDesktop
Si vous souhaitez exécuter un LLM non censuré sans acheter et installer votre propre matériel GPU, DaDesktop propose des bureaux virtuels cloud avec des ressources GPU dédiées. Vous pouvez exécuter des charges de travail de LLM locaux sur DaDesktop ou comparer les options GPU disponibles en fonction du modèle que vous souhaitez exécuter.
Commencez votre essai gratuit aujourd'hui
Menez une formation IT virtuelle fluide avec des laboratoires basés sur le cloud, sans interruption, juste un apprentissage évolutif qui fonctionne.