Dataconomy DE
Subscribe
No Result
View All Result
Dataconomy DE
Subscribe
No Result
View All Result
Dataconomy DE
No Result
View All Result

Die PDDL-Instruktur des MIT verbessert die Gültigkeit von Lama-3-8B-Planen

byEmre Çıtak
September 22, 2025
in Künstliche Intelligenz
Home Nachricht Künstliche Intelligenz
Share on FacebookShare on Twitter
Google Preferred Source

Forscher des Labors der Informatik und des Labors für Informatik und künstliche Intelligenz des MIT entwickelten PDDL-Instruct, ein Rahmen unter Verwendung des logischen Denkens und der externen Validierung, um die Art und Weise zu verbessern, wie große Sprachmodelle mehrstufige Pläne erzeugen und bis zu 94% Gültigkeit für bestimmte Benchmarks erzielen. Der Framework befasst sich mit dem gemeinsamen Versagen von großsprachigen Modellen (LLMs), logisch gültige Pläne zu erstellen, die häufig plausibel klingen, aber falsch sind. PDDL-Instruct dokumentiert dies, indem sie explizite Zustands- und Aktionssemantik in die Ground-Wahrheitsprüfung integriert. Durch „Fehlererziehung“ werden Modelle geschult, um Planversagen zu erklären, einschließlich unbefriedigter Voraussetzungen, falschen Effekte, Rahmenverletzungen oder einem nicht erreichten Ziel. Eine logische Methode für den Gedanke (COT) führt das Modell auch dazu, schrittweise Inferenz durchzuführen und detaillierte State-Action-State-Spuren zu erzeugen, die als ⟨sᵢ, aᵢ₊₁, sᵢ₊₁⟩ basierend auf formalen Semantik formatiert sind. Um die Korrektheit zu gewährleisten, wird jeder Schritt eines erzeugten Planes vom externen Val -Plan -Validator überprüft. Das System kann entweder binäres Feedback (gültig/ungültig) oder ein detailliertes Feedback erhalten, in dem angegeben wird, welche Voraussetzungen oder der Effekt fehlgeschlagen sind. Untersuchungen zeigten, dass detaillierte Rückmeldungen die stärksten Leistungsgewinne ergaben. PDDL-Instruct verwendet auch einen zweistufigen Optimierungsprozess. Die erste Stufe optimiert die Argumentationsketten des Modells durch Bestrafung von staatlichen Übersetzungsfehlern. Die zweite Stufe optimiert dann die endgültige Genauigkeit des Endaufgabenplans und schafft ein systematisches Trainingsregime. Das System wurde auf dem PlanBench -Benchmark bewertet, der die BlocksWorld-, Mystery BlocksWorld- und Logistics Planning Domains enthält. Mystery BlocksWorld ist besonders schwierig, da es Prädikatnamen verschleiert, um Musteranpassungen zu verhindern. Frühere Modelle berichteten über eine Gültigkeit von weniger als 5% in dieser Aufgabe ohne Toolunterstützung. Mit PDDL-Instruct erreichte ein Lama-3-8B-Modell bis zu 94% gültige Pläne für BlocksWorld. Auf Mystery BlocksWorld erzeugte das Rahmenverbesserungsordnungen, die bis zu 64-mal besser als Basismodelle angegeben wurden. In der Logistikdomäne wurden auch erhebliche Erhöhungen der gültigen Pläne aufgezeichnet. In allen Domänen zeigte der Rahmen bis zu einer absoluten Verbesserung von 66% bei der Erzeugung gültiger Pläne im Vergleich zu nicht abgestimmten Baselines. Die Leistung wurde durch ein detailliertes Feedback des Validators und längere Feedback -Budgets während des Trainings weiter verbessert. Dieser neuro-symbolische Ansatz begründet die Argumentation eines LLM in formalen Semantik, die automatisch überprüft werden. Der aktuelle Umfang beschränkt sich auf die Domänen der klassischen Planungsdomänen -Definition (PDDL) und erfordert Val als externes Orakel. Die Methode zeigt den Dienstprogramm für Agentenpipelines, die einen Verifier aufnehmen können, während Erweiterungen für zeitliche, numerische und kosten sensible Planung offene Herausforderungen bleiben.


Ausgewähltes Bildnachweis

Tags: Lama-3-8bMITPDDL-Instruktur

Related Posts

Anthropic erweitert Claude AI um die Funktion zur Bildschirmaufzeichnung des Unterrichts

Anthropic erweitert Claude AI um die Funktion zur Bildschirmaufzeichnung des Unterrichts

Juli 22, 2026
OpenAI bestätigt, dass sein KI-Modell Hugging Face im Test gehackt hat

OpenAI bestätigt, dass sein KI-Modell Hugging Face im Test gehackt hat

Juli 22, 2026
Substack führt neue KI-Transparenzfunktionen ein

Substack führt neue KI-Transparenzfunktionen ein

Juli 22, 2026
TikTok testet KI-Tool zur Erkennung von Deepfake-Imitationen

TikTok testet KI-Tool zur Erkennung von Deepfake-Imitationen

Juli 20, 2026
Alibaba stellt Qwen3.8-KI-Modell mit 2,4T-Parametern vor

Alibaba stellt Qwen3.8-KI-Modell mit 2,4T-Parametern vor

Juli 20, 2026
Google benennt NotebookLM in Gemini Notebook um

Google benennt NotebookLM in Gemini Notebook um

Juli 17, 2026

Recent Posts

  • Samsung gründet in diesem Jahr die RX-Abteilung, um humanoide Roboter zu bauen
  • Der KI-Anstieg wird dazu führen, dass US-Rechenzentren bis 2035 ein Fünftel des Stroms verbrauchen
  • Anthropic erweitert Claude AI um die Funktion zur Bildschirmaufzeichnung des Unterrichts
  • LLMs zeigten eine stärkere Einstellungsvoreingenommenheit als Menschen
  • Neue Mac-Malware tarnt sich als CrashReporter

Recent Comments

Es sind keine Kommentare vorhanden.
Dataconomy DE

COPYRIGHT © DATACONOMY MEDIA GMBH, ALL RIGHTS RESERVED.

  • Home
  • Sample Page

Follow Us

  • Home
  • Sample Page
No Result
View All Result
Subscribe

This website uses cookies to improve your experience. You can choose to accept or reject them. Visit our Privacy Policy.