Selbst gehosteter Dienst
mjun0812/flash-attention-prebuild-wheels avatar
mjun0812/flash-attention-prebuild-wheels

flash-attention-prebuild-wheels: Provide with pre-build flash-attention 2 and 3 package wheels on Linux and Windows using GitHub Actions

Projektüberblick: Stellen Sie mit GitHub Actions vorgefertigte Flash-Attention 2- und 3-Paketräder unter Linux und Windows bereit.

1.741 Sterne81 ForksPythonBSD-3-Clause
GitHub

Auf einen Blick

Was ist das?
Provide with pre-build flash-attention 2 and 3 package wheels on Linux and Windows using GitHub Actions. Dieser Überblick ordnet dokumentierte Funktionen, Einstieg und Grenzen ein.
Für wen ist es gedacht?
Geeignet ist flash-attention-prebuild-wheels für Nutzer, deren Aufgabe zu den im README beschriebenen Funktionen passt und die flash_attn-2.6.3+cu124torch2.5-cp312-cp312-linux_x86_64.whl in einer isolierten Umgebung prüfen können. Nicht geeignet ist es als Ersatz für Anforderungen, die die Quelle nicht belegt.
Darf ich es kommerziell nutzen?
Ja. BSD-3-Clause ist eine freizügige Lizenz: Sie dürfen darauf aufbauende Software nutzen, verändern und verkaufen, solange Sie die Urheberrechts- und Lizenzhinweise beibehalten.
Wird es noch gepflegt?
Ja. Das Repository hat innerhalb des letzten Tages neue Commits erhalten.
In welcher Sprache ist es geschrieben?
Hauptsächlich Python, laut der Sprachstatistik von GitHub.

Die Antworten beruhen auf den GitHub-Daten des Projekts (zuletzt abgeglichen am 18. September 2026) und auf unserer Analyse. Sie sind keine Rechtsberatung.

TIEFGEHENDE OPEN-SOURCE-ANALYSE

flash-attention-prebuild-wheels: flash_attn-2.6.3+cu124torch2.5-cp312-cp312-linux_x86_64.whl (1)

Flash-attention ist eine Aufmerksamkeitsimplementierung, deren Kompilierung aufwendig ist. Die README stellt fest, dass das Bauen sehr lange dauert und ressourcenintensiv ist. Dieses Repository bietet Wheels für flash-attention 2 und 3 an und enthält ausdrücklich Kombinationen von CUDA und PyTorch, die nicht offiziell verteilt werden. Die Projektbeschreibung sagt, dass GitHub Actions für den Bau auf Linux und Windows verwendet wird. Die README ergänzt, dass es auf einem selbst gehosteten Runner und AWS CodeBuild beruht und um Sponsoring bittet, um diese Infrastruktur zu pflegen.

flash-attention-prebuild-wheels: doc/packages.md (2)

Die README dokumentiert ein Muster für Wheel-Dateinamen: flash_attn-[flash_attn-Version]+cu[CUDA-Version]torch[PyTorch-Version]-cp[Python-Version]-cp[Python-Version]-linux_x86_64.whl. Zum Beispiel ergeben Python 3.11, CUDA 12.4, PyTorch 2.5 und flash_attn 2.6.3 die Datei flash_attn-2.6.3+cu124torch2.5-cp312-cp312-linux_x86_64.whl. Die Installation kann direkt über pip install mit der Release-URL erfolgen oder durch Herunterladen des Wheels und lokales pip install. Die README verweist auf eine Suchseite, ein Paketdokument und die Releases-Seite, um eine passende Version zu finden.

flash-attention-prebuild-wheels: create_matrix.py (3)

Die README berichtet über Abdeckungszahlen für drei Plattform-Ziele: Linux x86_64 hat 521 Wheels, Linux ARM64 hat 174, Windows hat 159, insgesamt 854, mit null fehlenden Einträgen in jeder Zeile. Seit v0.8.0 sind Flash Attention 3 Wheels verfügbar; sie erfordern Hopper (SM90) oder neuere GPUs und CUDA 12.3 oder neuer. Seit v0.7.0 werden Linux-Wheels mit manylinux2_28 gebaut und sind mit alten glibc-Versionen bis 2.17 kompatibel. Seit v0.5.0 enthalten Wheels eine lokale Versionskennzeichnung, die die CUDA- und PyTorch-Versionen identifiziert, sodass pip list etwas wie flash_attn==2.8.3+cu130torch2.9 anzeigt statt einer nackten Version.

flash-attention-prebuild-wheels: SM90 (4)

Die Build-Matrix verwendet GitHub-gehostete Runner für Linux x86_64 (ubuntu-22.04), Linux ARM64 (ubuntu-22.04-arm) und Windows x86_64 (windows-2022). Die README listet auch selbst gehostete Runner und AWS CodeBuild für Windows x86_64 auf, mit Container-Images wie ubuntu:24.04 oder manylinux_2_28_x86_64 für selbst gehostetes Linux. Für Benutzer, die eine Kombination benötigen, die nicht in den Releases ist, beschreibt die README einen Selbstbau-Workflow: Repository forken, optional einen selbst gehosteten Runner einrichten, create_matrix.py bearbeiten, um Versionen zu wählen, und ein v*.*.*-Tag pushen, um den Build auszulösen. Sie warnt, dass einige Versionskombinationen möglicherweise nicht bauen und dass GitHub-gehostete Runner an Jobzeitlimits stoßen können, weshalb Anweisungen für selbst gehostete Runner in self-hosted-runner/README.md bereitgestellt werden.

flash-attention-prebuild-wheels: flash_attn-2.6.3+cu124torch2.5-cp312-cp312-linux_x86_64.whl (5)

Das Repository ist unter der BSD-3-Clause-Lizenz veröffentlicht, mit Urheberrecht bei Junya Morioka für 2025. Die Lizenz erlaubt die Weiterverbreitung in Quell- und Binärform unter bestimmten Bedingungen und enthält einen Haftungsausschluss. Sie erwähnt keine Unterstützung, Sicherheitsgarantien oder Wartungspflichten. Die README bietet einen BibTeX-Eintrag zur Zitierung des Repositories selbst und zitiert auch die ursprünglichen Flash-Attention-Papiere von Dao et al. für FlashAttention und FlashAttention-2.

flash-attention-prebuild-wheels: doc/packages.md (6)

Die README verlinkt ein Release-Verlaufsdokument und enthält ein Stern-Verlaufsdiagramm und ein Download-Diagramm. Sie listet eine Reihe von Sponsoren und Mitwirkenden auf, darunter KiralyCraft für die Bereitstellung von Rechenressourcen und andere, die gesponsert oder Kaffee gekauft haben. Die Repository-Metadaten verzeichnen zum Zeitpunkt des Schreibens 1.660 Sterne, 74 Forks und 3 offene Issues. Die README liefert keine Leistungsbenchmarks, Übernahmestatistiken oder eine Support-Richtlinie, daher müssten Behauptungen über Geschwindigkeit oder Zuverlässigkeit, die über das Dokumentierte hinausgehen, separat verifiziert werden. Bei flash-attention-prebuild-wheels ist SM90 ein konkreter Prüfpunkt. Vergleiche die dokumentierte Eingabe mit der erzeugten Ausgabe und halte Version, Plattform und Fehlermeldung fest. Aussagen, die das README nicht belegt, bleiben offen; insbesondere lassen sich aus Repository-Kennzahlen keine Zusagen zu Verfügbarkeit, Leistung oder Support ableiten. Bei flash-attention-prebuild-wheels ist create_matrix.py ein konkreter Prüfpunkt. Vergleiche die dokumentierte Eingabe mit der erzeugten Ausgabe und halte Version, Plattform und Fehlermeldung fest. Aussagen, die das README nicht belegt, bleiben offen; insbesondere lassen sich aus Repository-Kennzahlen keine Zusagen zu Verfügbarkeit, Leistung oder Support ableiten. Bei flash-attention-prebuild-wheels ist doc/packages.md ein konkreter Prüfpunkt. Vergleiche die dokumentierte Eingabe mit der erzeugten Ausgabe und halte Version, Plattform und Fehlermeldung fest. Aussagen, die das README nicht belegt, bleiben offen; insbesondere lassen sich aus Repository-Kennzahlen keine Zusagen zu Verfügbarkeit, Leistung oder Support ableiten. Bei flash-attention-prebuild-wheels ist SM90 ein konkreter Prüfpunkt. Vergleiche die dokumentierte Eingabe mit der erzeugten Ausgabe und halte Version, Plattform und Fehlermeldung fest. Aussagen, die das README nicht belegt, bleiben offen; insbesondere lassen sich aus Repository-Kennzahlen keine Zusagen zu Verfügbarkeit, Leistung oder Support ableiten. Bei flash-attention-prebuild-wheels ist create_matrix.py ein konkreter Prüfpunkt. Vergleiche die dokumentierte Eingabe mit der erzeugten Ausgabe und halte Version, Plattform und Fehlermeldung fest. Aussagen, die das README nicht belegt, bleiben offen; insbesondere lassen sich aus Repository-Kennzahlen keine Zusagen zu Verfügbarkeit, Leistung oder Support ableiten.

Redaktionelles Fazit

Geeignet ist flash-attention-prebuild-wheels für Nutzer, deren Aufgabe zu den im README beschriebenen Funktionen passt und die flash_attn-2.6.3+cu124torch2.5-cp312-cp312-linux_x86_64.whl in einer isolierten Umgebung prüfen können. Nicht geeignet ist es als Ersatz für Anforderungen, die die Quelle nicht belegt. Vor der Entscheidung sollten flash_attn-2.6.3+cu124torch2.5-cp312-cp312-linux_x86_64.whl, doc/packages.md, create_matrix.py mit der eigenen Plattform, Version und erwarteten Ausgabe verglichen werden.

Offizielle Quellen

  1. Official README
  2. Project repository
  3. Release notes
Community-Notizen

Community-Notizen