Topic

#Prompt engineering

Le prompt engineering consiste à formuler et structurer les instructions données à un modèle de langage pour obtenir des réponses précises et utiles. Par exemple, des techniques comme le chain-of-thought prompting améliorent nettement les performances de GPT-4 sur des tâches de raisonnement.

40Articles
8Sources
65Signal moyen
arXiv cs.CL·

SAGE: Stochastic Prompt Optimization via Agent-Guided Exploration

SAGE est un framework d'optimisation stochastique de prompts via exploration guidée par agents multi-agents. Comparaison de trois stratégies : recherche aléatoire informée par erreurs, algorithme génétique, et SAGE avec exécution de code diagnostique. Déploiement sur chatbot santé mentale : 8 cycles d'A/B tests bruyants produisent un gain statistiquement robuste en rétention.

Prompt engineeringAgents IAMulti-agents
SIG
72
HYP
00
arXiv cs.CL·

Want Better Synthetic Data? Steer It: Activation Steering for Low-Resource Language Generation

Activation steering améliore la génération de données synthétiques pour les langues peu dotées. Deux stratégies testées : Language Steering (identité linguistique) et Quality Steering (bien-formedness). Évaluation sur 4 LLMs open-source, 11 langues, tâches de classification. Steering sur couches précoces augmente la diversité et la performance aval.

Prompt engineeringFine-tuningBenchmarks
SIG
72
HYP
00
arXiv cs.CL·

Efficient Financial Language Understanding via Distillation with Synthetic Data

Framework de distillation avec données synthétiques pour l'analyse de sentiment financier. Transfert de connaissances d'un modèle teacher instruction-tuned vers des modèles compacts. Sélection de seeds par clustering pour générer des données synthétiques via few-shot prompting. Le modèle compact surpasse le teacher sur textes complexes/bruyants avec supervision minimale.

Fine-tuningRAGPrompt engineering
SIG
72
HYP
00
arXiv cs.CL·

Implicit vs. Explicit Prompting Strategies for LVLMs in Referential Communication

Deux études récentes tirent des conclusions contradictoires sur la capacité des LVLMs à coordonner des expressions référentielles efficaces. Cette recherche contrôle les différences de tâches et compare directement les styles de prompting. Les modèles coordonnent efficacement avec un prompting explicite, mais échouent à inférer le besoin d'efficacité communicative avec un prompting implicite.

Prompt engineeringVisionÉvaluations
SIG
72
HYP
00
arXiv cs.CL·

Bridging Functional Correctness and Runtime Efficiency Gaps in LLM-Based Code Translation

SwiftTrans, un framework de traduction de code par LLM, combine exploration multi-perspective (MpTranslator avec apprentissage en contexte parallèle) et sélection consciente des différences (DiffSelector) pour améliorer à la fois la correction fonctionnelle et l'efficacité runtime. Évaluation sur CodeNet, F2SBench et SwiftBench.

Génération de codePrompt engineeringBenchmarks
SIG
72
HYP
00
arXiv cs.AI·

ChatPlanner: A Large Language Model Framework for Personalized Public Transit Routing

ChatPlanner est un framework utilisant des LLMs fine-tunés avec RAG pour extraire les préférences utilisateur en langage naturel et les intégrer dans un algorithme d'optimisation de trajets en transport public. Évalué sur 8 personas et 5 contextes, le système combine fine-tuning (structure de sortie) et RAG (contexte spécifique) pour identifier des solutions ignorées par les planificateurs existants.

RAGFine-tuningPrompt engineering
SIG
65
HYP
00
arXiv cs.CL·

SHARD: Safe and Helpful Alignment via Self-Reframing Distillation

SHARD est une méthode de distillation par auto-reformulation pour améliorer l'équilibre sécurité-utilité des LLM. Elle réécrit les prompts sensibles selon des principes philosophiques, reformule les réponses de manière sûre et plus utile, puis fine-tune le modèle sur ces réponses auto-reformulées. Testée sur DNA et LINGUASAFE, SHARD améliore l'utilité tout en préservant la sécurité.

Fine-tuningSécurité IAAlignement
SIG
72
HYP
00
arXiv cs.AI·

APEX: Adaptive Principle EXtraction A Three-Layer Self-Evolution Framework for Production AI Agents

APEX est un framework d'auto-amélioration pour agents IA en production qui évolue simultanément sur trois dimensions : le prompt harness (L1), les principes comportementaux (L2) et la topologie du workflow (L3). Testé sur Joe, un super-agent NVIDIA Nemotron, APEX atteint un Health Score de 0.570 (+90% vs baseline) et distille 6 principes réutilisables avec seulement 4 appels LLM.

Agents IAPrompt engineeringReinforcement learning
SIG
72
HYP
00
arXiv cs.CL·

Encode Errors: Representational Retrieval of In-Context Demonstrations for Multilingual Grammatical Error Correction

Méthode de récupération de démonstrations in-context basée sur les représentations d'erreurs grammaticales (GER) pour la correction grammaticale multilingue. Sur 8 modèles open-source 8B, les résultats égalent GPT-4o-mini et Deepseek2.5. Pour les langues peu dotées, amélioration F₀.₅ jusqu'à 1.20× vs baseline.

RAGPrompt engineeringBenchmarks
SIG
72
HYP
00
arXiv cs.CL·

Persuasion Index: A Theory-Guided Framework for Persuasion Analysis

Persuasion Index (PI) est une taxonomie de 15 dimensions fondée sur les théories de la persuasion en psychologie et communication. Implémentation avec 55 sous-features basées sur lexiques et détecteurs. Évaluation sur 4 datasets publics montre que PI fournit un espace de features partagé pour interpréter les patterns rhétoriques. Modèles linéaires légers et interprétables. Package open-source et interface web.

PapersSécurité IAPrompt engineering
SIG
72
HYP
00
arXiv cs.AI·

HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry

HarnessX est une plateforme pour créer des harnesses d'agents IA composables et adaptatifs. Elle utilise AEGIS, un moteur d'évolution multi-agent piloté par les traces d'exécution, pour optimiser les prompts, outils et flux de contrôle. Sur 5 benchmarks (ALFWorld, GAIA, WebShop, tau³-Bench, SWE-bench), HarnessX atteint +14,5% de gain moyen (+44% max), sans augmenter la taille du modèle.

Agents IAMulti-agentsPrompt engineering
SIG
75
HYP
00
arXiv cs.CL·

QIAS 2026: Overview of the Shared Task on Islamic Inheritance Reasoning

QIAS 2026 est un défi partagé évaluant la capacité des LLM à raisonner sur l'héritage islamique. Basé sur MAWARITH (12 500 cas arabes annotés), il requiert calcul complet : identification des héritiers et attribution des parts. 16 équipes ont testé prompting, RAG et fine-tuning. Les résultats montrent que l'interprétation légale précise et le raisonnement numérique structuré restent très difficiles.

BenchmarksRaisonnementRAG
SIG
75
HYP
00
arXiv cs.AI·

YeasierAgent: Agentic Social Sandbox as a Canvas for Intent-Driven Creation of Platform-Agnostic Symbiotic Agent-Native Applications

YeasierAgent propose un paradigme de construction d'applications basé sur des agents symbiotiques, des mondes narratifs et des interactions conscientes de la scène. Le système unifie la génération automatisée, les mondes créés par les utilisateurs et la collaboration multi-agents spatiale pour créer des applications agent-natives cross-platform sans dépendre de mises en page graphiques fixes.

Agents IAMulti-agentsPrompt engineering
SIG
45
HYP
00
Reddit r/LocalLLaMA·

Codebase getting larger - Qwen3.6-27B starting to compound issues - how to work smartly with this model?

Développeur utilisant Qwen3.6-27B via llama.cpp rencontre des bugs récurrents dans son codebase Python malgré un contexte de 128K tokens. Teste différentes stratégies : lecture complète du projet vs focus sur fonctions spécifiques, désactivation de la quantization KV. Cherche approches pour minimiser les erreurs du modèle.

QwenGénération de codePrompt engineering
SIG
35
HYP
00
arXiv cs.AI·

TrajGenAgent: A Hierarchical LLM Agent for Human Mobility Trajectory Generation

TrajGenAgent est un framework d'agent LLM hiérarchique pour générer des trajectoires de mobilité humaine réalistes sans fine-tuning. Un orchestrateur LLM synthétise des chaînes d'activités via in-context learning, puis un workflow déterministe les ancre via récupération POI personnalisée, sélection de localisation et estimation de durée. Évaluation par détection d'anomalies sur données de benchmark.

Agents IAPrompt engineeringRaisonnement
SIG
72
HYP
00
Prompt engineering — actualité IA · Signal IA