arxiv-mcp-server: LaTeX-Abschnitte und BibTeX lokal für Agenten
A local MCP server for agent literature work. Original-LaTeX section reads, BibTeX from arXiv metadata, and topic watches. Papers stay on disk. Search is optional.
Auf einen Blick
- Was ist das?
- Ein lokaler MCP-Server, der den Literaturkreislauf um Papierkennung, Gliederung, einzelnen Abschnitt und Zitat herum baut. Die Suche ist ausdrücklich optional, die Dateien bleiben auf der Platte.
- Für wen ist es gedacht?
- Sinnvoll ist der Server für Agenten-Workflows, die Papiere abschnittsweise lesen und Zitate aus arXiv-Metadaten statt aus geratenen Angaben brauchen, und für Umgebungen, in denen die PDFs auf der Platte bleiben sollen. Wer Volltextsuche über einen großen Korpus, Ranking oder Zitationsgraphen als Kernfunktion benötigt, ist hier falsch, weil das README diese Aufgaben ausdrücklich an externe Dienste auslagert.
- Darf ich es kommerziell nutzen?
- Ja. Apache-2.0 ist eine freizügige Lizenz: Sie dürfen darauf aufbauende Software nutzen, verändern und verkaufen, solange Sie die Urheberrechts- und Lizenzhinweise beibehalten.
- Wird es noch gepflegt?
- Ja. Die letzten Commits kamen vor 20 Tagen.
- In welcher Sprache ist es geschrieben?
- Hauptsächlich Python, laut der Sprachstatistik von GitHub.
Die Antworten beruhen auf den GitHub-Daten des Projekts (zuletzt abgeglichen am 15. September 2026) und auf unserer Analyse. Sie sind keine Rechtsberatung.
TIEFGEHENDE OPEN-SOURCE-ANALYSE
Welches Problem der Server löst und für wen
Die meisten Werkzeuge rund um arXiv sind Suchwerkzeuge. Sie nehmen eine Anfrage, treffen eine Auswahl und liefern Trefferlisten zurück. Genau an dieser Stelle setzt das README eine Abgrenzung: Was lokal bleibt, ist der Literaturkreislauf, also das Lesen der vom Autor eingereichten LaTeX-Quelle Abschnitt für Abschnitt, der Export von BibTeX aus den arXiv-Metadaten und das Führen von Themen-Watches auf der Platte. Suche, Quellenabruf, Zitationsgraphen und Downloads gehen laut README an die jeweiligen externen Dienste. Der Server ist damit kein Ersatz für eine Suchmaschine, sondern die lokale Hälfte eines Agenten-Workflows.
Die Zielgruppe ist entsprechend eng: Entwickler und Forscher, die einem LLM-Agenten beibringen sollen, ein Papier wirklich zu lesen, statt es zusammenzufassen. Der im README genannte Arbeitszyklus lautet Papierkennung, Gliederung, ein Abschnitt, Zitate. Wer nur ein Abstract braucht, wird mit diesem Umweg nicht glücklich. Wer dagegen wiederkehrend dieselben Papiere aufschlägt und dabei auf die Autorenfassung statt auf eine PDF-Extraktion angewiesen ist, bekommt hier eine Struktur, die ein Agent ohne eigene Dateiverwaltung nutzen kann.
Abschnittsweises Lesen statt Volltext auf einmal
Der Kern ist die Aufteilung des Lesens in drei Schritte. Zuerst wird eine Gliederung erzeugt, dann wird genau ein Abschnitt gelesen, dann werden Zitate gezogen. Das ist ein bewusst schmaler Datenfluss: Der Agent bekommt nie das ganze Dokument, sondern immer nur den Ausschnitt, den er für den nächsten Schritt braucht. Für Kontextfenster ist das der wesentliche Vorteil, denn ein Paper in Original-LaTeX kann erheblich länger sein als das, was sinnvoll in einen Prompt passt.
Die Quelle ist dabei die vom Autor eingereichte LaTeX-Fassung, nicht eine aus dem PDF zurückgewonnene Textfolge. Der Unterschied ist praktisch: Abschnittsgrenzen, Formeln und Zitatbefehle liegen in LaTeX explizit vor, während sie in einer PDF-Extraktion rekonstruiert werden müssen. Das README nennt diesen Punkt als Alleinstellungsmerkmal. Es nennt allerdings keine Angaben dazu, wie mit Einreichungen umgegangen wird, die keine vollständige LaTeX-Quelle mitliefern, und auch nichts über den Umgang mit mehrteiligen Dokumenten oder eingebundenen Dateien. Wer darauf angewiesen ist, sollte das vorab klären, denn das Material erlaubt dazu keine Aussage.
BibTeX kommt laut README aus den arXiv-Metadaten und damit aus einer autoritativen Quelle statt aus einer vom Modell formulierten Angabe. Das ist der zweite Teil des Kreislaufs: Lesen erzeugt Verständnis, die Metadaten erzeugen das Zitat.
Installation über uvx und die npm-Falle
Der Standardweg ist ein einziger Befehl ohne Klonen und ohne vorbereitete Python-Umgebung:
uvx arxiv-mcp-server
Dahinter steht uv, das uvx bereitstellt. Clients, die das mcpServers-JSON-Format akzeptieren, bekommen einen stdio-Eintrag:
{ "mcpServers": { "arxiv": { "type": "stdio", "command": "uvx", "args": ["arxiv-mcp-server"] } } }
Das Standardverzeichnis für Papiere ist ~/.arxiv-mcp-server/papers. Ein anderer Ort wird über einen zusätzlichen Eintrag in args gewählt, konkret "--storage-path", gefolgt von einem absoluten Pfad.
Ein Hinweis im README verdient besondere Aufmerksamkeit: Unter demselben Namen existiert ein nicht verwandtes npm-Paket. Der Server darf deshalb nicht mit npm, pnpm oder npx arxiv-mcp-server installiert werden. Wer aus Gewohnheit npx verwendet, installiert etwas anderes. Die unterstützte Fassung liegt auf PyPI als arxiv-mcp-server==0.7.2.
Für einzelne Clients gibt es kürzere Wege. Claude Code kennt claude mcp add --transport stdio --scope user arxiv -- uvx arxiv-mcp-server, Codex nutzt codex mcp add arxiv -- uvx arxiv-mcp-server, Hermes folgt mit hermes mcp add arxiv --command uvx --args arxiv-mcp-server und anschließend hermes mcp test arxiv. Daneben existieren Plugin-Wege, die zusätzlich eine mitgelieferte Recherche-Fähigkeit installieren, sowie ein gebündeltes .mcpb-Paket für Claude Desktop auf macOS. Nach der Installation lässt sich die direkte MCP-Verbindung mit claude mcp get arxiv beziehungsweise codex mcp get arxiv prüfen.
Was das README nicht beantwortet
Die Dokumentation ist bei den Installationswegen ungewöhnlich breit und bei den Laufzeiteigenschaften auffallend dünn. Es gibt keine Angabe zu Rate Limits, keine zu Netzwerkfehlern beim Abruf, keine zu Wiederholungsversuchen und keine zum Verhalten, wenn ein Papier nicht mehr verfügbar ist. Auch zur Größe des lokalen Verzeichnisses findet sich nichts. Wer viele Papiere in LaTeX-Fassung sammelt, sollte den Platzbedarf selbst im Blick behalten, weil der Server die Dateien ausdrücklich auf der Platte hält.
Ein zweiter Punkt betrifft die Themen-Watches. Das README nennt sie als dritte lokale Fähigkeit, beschreibt aber weder das Format der Ablage noch die Häufigkeit der Prüfung. Ob ein Watch beim Start des Servers ausgewertet wird, ob er einen Hintergrundprozess braucht oder ob er nur auf Anfrage des Agenten reagiert, geht aus dem Material nicht hervor. Das ist eine Lücke, die man vor dem Aufsetzen eines wiederkehrenden Beobachtungslaufs kennen sollte.
Schließlich ist der Hinweis auf die optionale Suche ernst zu nehmen. Wenn ein Workflow ohne Suchschritt nicht auskommt, hängt seine Zuverlässigkeit an einem externen Dienst, dessen Verhalten der Server nicht kontrolliert.
Wo der Ansatz an seine Grenzen stößt
Der abschnittsweise Ansatz ist eine Einschränkung, die sich als Vorteil verkauft. Wer ein Papier in einem Durchgang bewerten will, muss den Agenten durch Gliederung und Einzelabschnitte führen, was mehr Aufrufe und mehr Zwischenschritte bedeutet als ein einzelner Volltextabruf. Bei kurzen Arbeiten ist der Umweg reine Zusatzarbeit.
Die Abhängigkeit von der LaTeX-Quelle ist der zweite Grenzfall. Nicht jede Veröffentlichung liegt in dieser Form vor, und das README beschreibt keinen Ersatzweg für Fälle, in denen nur ein PDF verfügbar ist. Für einen Agenten, der einen breiten Korpus abdecken soll, ist das ein enges Nadelöhr.
Der dritte Punkt betrifft die Rolle des Werkzeugs. Es ist ein Zulieferer für einen Agenten, kein eigenständiges Rechercheinstrument. Es gibt keine Oberfläche, kein Ranking, keine Empfehlung. Die Auswahl, welches Papier überhaupt gelesen wird, findet außerhalb statt. Wer diese Auswahl nicht selbst treffen will, braucht etwas anderes.
Alternative: ein Such- und Volltextdienst als MCP-Server
Die naheliegende Alternative ist ein MCP-Server, der auf einem Suchindex oder einem Volltextkorpus aufsetzt. Der Unterschied liegt nicht in der Schnittstelle, sondern in der Reihenfolge der Arbeit. Ein suchbasierter Server beginnt mit einer Anfrage, liefert Treffer und oft gleich ganze Textblöcke zurück. Der Agent bekommt also zuerst eine Auswahl und dann Inhalt, wobei die Abschnittsgrenzen in der Regel nicht erhalten bleiben.
arxiv-mcp-server dreht das um. Der Einstieg ist eine Papierkennung, nicht eine Suchanfrage. Der Inhalt kommt strukturiert und in kleinen Portionen, und die Zitate stammen aus den Metadaten der Quelle. Für einen Agenten, der ein einzelnes Papier durcharbeiten und belegen soll, ist das die passendere Form. Für einen Agenten, der einen Überblick über ein Feld gewinnen soll, ist es die falsche, weil ihm die Auswahl fehlt.
Wer beides braucht, kombiniert zwei Server: einen für die Auswahl, diesen für die Tiefe. Das ist keine Notlösung, sondern entspricht der Aufteilung, die das README selbst beschreibt, wenn es Suche und Quellenabruf an externe Dienste verweist.
Wartung, Versionen und Lizenz
Die Veröffentlichungspraxis ist eng getaktet: v0.7.0 am 22. August 2026, v0.7.1 am 23. August, v0.7.2 am 24. August, bei einem letzten Push am 26. August. Drei Releases in drei Tagen deuten auf eine Phase aktiver Nacharbeit hin. Wer den Server produktiv einsetzt, sollte die Version festnageln, statt uvx still auf die jeweils neueste Fassung zeigen zu lassen, weil das README selbst mit arxiv-mcp-server==0.7.2 eine konkrete Fassung nennt.
Ein Upgrade ist technisch billig. Es gibt keinen Klon, keine virtuelle Umgebung und keine Konfigurationsdatei im Repository, die gepflegt werden müsste. Der Preis dafür liegt woanders: Die Versionsnummer steht in der Client-Konfiguration, und bei jedem Sprung ist zu prüfen, ob sich Tool-Namen oder Parameter geändert haben, weil der Agent auf beides fest verdrahtet zugreift.
Lizenziert ist das Projekt unter Apache-2.0. Diese Lizenz erlaubt Weitergabe und Änderung unter Bedingungen, unter anderem der Beibehaltung von Copyright- und Lizenzhinweisen sowie einer Änderungsangabe. Wer den Server forkt und intern verteilt, sollte die NOTICE-Praxis und die Patentklausel kennen. Eine rechtliche Bewertung ersetzt das nicht, und für den konkreten Einsatzfall ist sie ohnehin nicht hier zu leisten. Der Austausch mit einem gleichnamigen npm-Paket ist ausdrücklich kein Lizenzthema, sondern eine Verwechslungsgefahr bei der Installation.
Redaktionelles Fazit
Sinnvoll ist der Server für Agenten-Workflows, die Papiere abschnittsweise lesen und Zitate aus arXiv-Metadaten statt aus geratenen Angaben brauchen, und für Umgebungen, in denen die PDFs auf der Platte bleiben sollen. Wer Volltextsuche über einen großen Korpus, Ranking oder Zitationsgraphen als Kernfunktion benötigt, ist hier falsch, weil das README diese Aufgaben ausdrücklich an externe Dienste auslagert. Vor dem Ausrollen zu prüfen sind drei Dinge: dass die Installation über uvx und nicht über npm erfolgt, weil ein gleichnamiges npm-Paket existiert, dass der Pfad unter ~/.arxiv-mcp-server/papers groß genug ist oder per --storage-path verlegt wird, und dass der Client das mcpServers-JSON-Format akzeptiert. Ob die Extraktion von LaTeX-Abschnitten bei stark abweichend formatierten Einreichungen trägt, lässt sich nur am eigenen Korpus feststellen.
Community-Notizen