Prg: Unterschied zwischen den Versionen
Zur Navigation springen
Zur Suche springen
Klaus (Diskussion | Beiträge) (Die Seite wurde neu angelegt: „ GROBID (Java-Script) wertet PDF-Dateien aus und legt die Ergebnisse jeder PDF-Datei in einer eigenen Datei ab grobid-client --input Pfad\zu\HSS\ --output results\ --recursive Zotero (Zitieren) legt Literaturliste an“) |
Klaus (Diskussion | Beiträge) Keine Bearbeitungszusammenfassung |
||
| Zeile 1: | Zeile 1: | ||
GROBID (Java-Script) | GROBID (Java-Script) | ||
wertet PDF-Dateien aus und legt die Ergebnisse | wertet PDF-Dateien aus und legt die Ergebnisse<ref group="Anm."> | ||
grobid-client --input Pfad\zu\HSS\ --output results\ --recursive | <rem> | ||
A) Dokumentstruktur | |||
* Titel / Untertitel / Autoren / Institutionen / Abstract / Keywords / Sprache | |||
* Publikationsjahr / DOI (falls vorhanden) / ISBN/ISSN (falls vorhanden) | |||
B) Seiteninformationen | |||
* Seitenzahl (immer zuverlässig) / Seitenstruktur (Header/Footer, Abschnittsgrenzen) | |||
C) Fußnoten | |||
* GROBID erkennt Fußnoten als: <note> / <ref type="footnote"> | |||
D) Quellen / Literaturverzeichnis | |||
* GROBID erkennt: Literaturverzeichnis / „References“ / „Bibliography“ / „Literatur“ / „Quellen“ | |||
* Jede Quelle wird als eigenes <biblStruct>‑Element ausgegeben. | |||
E) Textkörper vs. Anhänge | |||
* GROBID unterscheidet: | |||
<div type="body"> → Haupttext | |||
<div type="appendix"> → Anhänge | |||
<div type="annex"> → Zusatzmaterial | |||
<figure> / <table> → eingebettete Elemente | |||
F) Weitere Elemente | |||
* Tabellen / Abbildungen / Überschriften / Kapitelstruktur / Zitate / Referenzverweise / Formeln (teilweise) | |||
</rem> | |||
</ref> | |||
grobid-client --input Pfad\zu\HSS\ --output results\ --recursive<ref group="Anm."> | |||
@echo off | |||
REM Pfade anpassen | |||
set GROBID_HOME=C:\grobid | |||
set INPUT_DIR=C:\HSS_1800 | |||
set OUTPUT_DIR=C:\HSS_1800_TEI | |||
REM GROBID-Service starten | |||
start "GROBID" java -jar %GROBID_HOME%\grobid-service\grobid-service.jar | |||
REM Warten bis der Service läuft | |||
timeout /t 5 | |||
REM Batch-Verarbeitung starten | |||
python %GROBID_HOME%\grobid-client\grobid_client.py \ | |||
--input %INPUT_DIR% \ | |||
--output %OUTPUT_DIR% \ | |||
--processFulltext \ | |||
--recursive | |||
echo Verarbeitung abgeschlossen. | |||
pause</ref> | |||
Zotero (Zitieren) | Zotero (Zitieren) | ||
legt Literaturliste an | legt Literaturliste an | ||
== Anhang == | |||
=== Anmerkungen === | |||
<references group="Anm." /> | |||
=== Einzelnachweise === | |||
<references /> | |||
Version vom 31. August 2026, 22:28 Uhr
GROBID (Java-Script) wertet PDF-Dateien aus und legt die Ergebnisse[Anm. 1] grobid-client --input Pfad\zu\HSS\ --output results\ --recursive[Anm. 2]
Zotero (Zitieren) legt Literaturliste an
Anhang
Anmerkungen
- ↑
<rem>
A) Dokumentstruktur
- Titel / Untertitel / Autoren / Institutionen / Abstract / Keywords / Sprache
- Publikationsjahr / DOI (falls vorhanden) / ISBN/ISSN (falls vorhanden)
- Seitenzahl (immer zuverlässig) / Seitenstruktur (Header/Footer, Abschnittsgrenzen)
- GROBID erkennt Fußnoten als: <note> / <ref type="footnote">
- GROBID erkennt: Literaturverzeichnis / „References“ / „Bibliography“ / „Literatur“ / „Quellen“
- Jede Quelle wird als eigenes <biblStruct>‑Element ausgegeben.
- GROBID unterscheidet:
→ Haupttext→ Anhänge→ Zusatzmaterial <figure> / → eingebettete Elemente F) Weitere Elemente- Tabellen / Abbildungen / Überschriften / Kapitelstruktur / Zitate / Referenzverweise / Formeln (teilweise)
- ↑ @echo off REM Pfade anpassen set GROBID_HOME=C:\grobid set INPUT_DIR=C:\HSS_1800 set OUTPUT_DIR=C:\HSS_1800_TEI REM GROBID-Service starten start "GROBID" java -jar %GROBID_HOME%\grobid-service\grobid-service.jar REM Warten bis der Service läuft timeout /t 5 REM Batch-Verarbeitung starten python %GROBID_HOME%\grobid-client\grobid_client.py \ --input %INPUT_DIR% \ --output %OUTPUT_DIR% \ --processFulltext \ --recursive echo Verarbeitung abgeschlossen. pause
Einzelnachweise