Prg: Unterschied zwischen den Versionen
Zur Navigation springen
Zur Suche springen
Klaus (Diskussion | Beiträge) Keine Bearbeitungszusammenfassung |
Klaus (Diskussion | Beiträge) Keine Bearbeitungszusammenfassung |
||
| (2 dazwischenliegende Versionen desselben Benutzers werden nicht angezeigt) | |||
| Zeile 1: | Zeile 1: | ||
Zotero (Zitieren) | |||
legt Literaturliste an | |||
pdfinfo liest den PDF-Header aus.<ref><pre> | |||
A Dokument‑Metadaten | |||
* Titel / Autor / Ersteller‑Programm (z. B. Word, LibreOffice, LaTeX) | |||
* Erstellungsdatum / Änderungsdatum / Produzent (z. B. Adobe PDF Library) / PDF‑Version (1.3–1.7, PDF/A usw.) | |||
B Struktur & Seiteninformationen | |||
* Anzahl der Seiten / Seitenformate (A4, Letter, Sondergrößen) / Seitenrotation (0°, 90°, 180°, 270°) | |||
* Box‑Informationen (MediaBox, CropBox, TrimBox, BleedBox) / Ob die PDF getaggt ist (für Barrierefreiheit) | |||
C Sicherheitsinformationen | |||
* Verschlüsselt / unverschlüsselt / Verschlüsselungsstärke (40‑bit, 128‑bit, AES‑256) | |||
* Erlaubte Aktionen (Drucken, Kopieren, Kommentieren) | |||
* Inhaltsinformationen / Anzahl eingebetteter Schriftarten / Schriftarten‑Typen (TrueType, Type1, CID) | |||
* Eingebettete oder nicht eingebettete Fonts / Farbprofile (ICC) | |||
* b Transparenzen enthalten sind / Ob Formularfelder vorhanden sind | |||
D Technische Details | |||
* Linearisiert (für Web‑Optimierung) / Optimiert / komprimiert / XMP‑Metadaten vorhanden / PDF/A‑Konformität (A‑1b, A‑2a usw.) | |||
</pre></ref> | |||
GROBID (Java-Script) | GROBID (Java-Script) | ||
wertet PDF-Dateien aus und legt die Ergebnisse<ref group="Anm."> | wertet PDF-Dateien aus und legt die Ergebnisse<ref group="Anm."> | ||
< | <pre> | ||
A) Dokumentstruktur | A) Dokumentstruktur | ||
* Titel / Untertitel / Autoren / Institutionen / Abstract / Keywords / Sprache | * Titel / Untertitel / Autoren / Institutionen / Abstract / Keywords / Sprache | ||
| Zeile 20: | Zeile 42: | ||
F) Weitere Elemente | F) Weitere Elemente | ||
* Tabellen / Abbildungen / Überschriften / Kapitelstruktur / Zitate / Referenzverweise / Formeln (teilweise) | * Tabellen / Abbildungen / Überschriften / Kapitelstruktur / Zitate / Referenzverweise / Formeln (teilweise) | ||
</ | </pre> | ||
</ref> | </ref> in einer eigenen Datei für jede PDF-Datei an. | ||
grobid-client --input Pfad\zu\HSS\ --output results\ --recursive<ref group="Anm."> | grobid-client --input Pfad\zu\HSS\ --output results\ --recursive<ref group="Anm."> | ||
<pre> | |||
@echo off | @echo off | ||
REM Pfade anpassen | REM Pfade anpassen | ||
| Zeile 43: | Zeile 66: | ||
echo Verarbeitung abgeschlossen. | echo Verarbeitung abgeschlossen. | ||
pause</ref> | pause | ||
</pre></ref> | |||
Aktuelle Version vom 31. August 2026, 23:07 Uhr
Zotero (Zitieren) legt Literaturliste an
pdfinfo liest den PDF-Header aus.[1]
GROBID (Java-Script) wertet PDF-Dateien aus und legt die Ergebnisse[Anm. 1] in einer eigenen Datei für jede PDF-Datei an. grobid-client --input Pfad\zu\HSS\ --output results\ --recursive[Anm. 2]
Anhang
Anmerkungen
- ↑
A) Dokumentstruktur * Titel / Untertitel / Autoren / Institutionen / Abstract / Keywords / Sprache * Publikationsjahr / DOI (falls vorhanden) / ISBN/ISSN (falls vorhanden) B) Seiteninformationen * Seitenzahl (immer zuverlässig) / Seitenstruktur (Header/Footer, Abschnittsgrenzen) C) Fußnoten * GROBID erkennt Fußnoten als: <note> / <ref type="footnote"> D) Quellen / Literaturverzeichnis * GROBID erkennt: Literaturverzeichnis / „References“ / „Bibliography“ / „Literatur“ / „Quellen“ * Jede Quelle wird als eigenes <biblStruct>‑Element ausgegeben. E) Textkörper vs. Anhänge * GROBID unterscheidet: <div type="body"> → Haupttext <div type="appendix"> → Anhänge <div type="annex"> → Zusatzmaterial <figure> / <table> → eingebettete Elemente F) Weitere Elemente * Tabellen / Abbildungen / Überschriften / Kapitelstruktur / Zitate / Referenzverweise / Formeln (teilweise)
- ↑
@echo off REM Pfade anpassen set GROBID_HOME=C:\grobid set INPUT_DIR=C:\HSS_1800 set OUTPUT_DIR=C:\HSS_1800_TEI REM GROBID-Service starten start "GROBID" java -jar %GROBID_HOME%\grobid-service\grobid-service.jar REM Warten bis der Service läuft timeout /t 5 REM Batch-Verarbeitung starten python %GROBID_HOME%\grobid-client\grobid_client.py \ --input %INPUT_DIR% \ --output %OUTPUT_DIR% \ --processFulltext \ --recursive echo Verarbeitung abgeschlossen. pause
Einzelnachweise
- ↑
A Dokument‑Metadaten * Titel / Autor / Ersteller‑Programm (z. B. Word, LibreOffice, LaTeX) * Erstellungsdatum / Änderungsdatum / Produzent (z. B. Adobe PDF Library) / PDF‑Version (1.3–1.7, PDF/A usw.) B Struktur & Seiteninformationen * Anzahl der Seiten / Seitenformate (A4, Letter, Sondergrößen) / Seitenrotation (0°, 90°, 180°, 270°) * Box‑Informationen (MediaBox, CropBox, TrimBox, BleedBox) / Ob die PDF getaggt ist (für Barrierefreiheit) C Sicherheitsinformationen * Verschlüsselt / unverschlüsselt / Verschlüsselungsstärke (40‑bit, 128‑bit, AES‑256) * Erlaubte Aktionen (Drucken, Kopieren, Kommentieren) * Inhaltsinformationen / Anzahl eingebetteter Schriftarten / Schriftarten‑Typen (TrueType, Type1, CID) * Eingebettete oder nicht eingebettete Fonts / Farbprofile (ICC) * b Transparenzen enthalten sind / Ob Formularfelder vorhanden sind D Technische Details * Linearisiert (für Web‑Optimierung) / Optimiert / komprimiert / XMP‑Metadaten vorhanden / PDF/A‑Konformität (A‑1b, A‑2a usw.)