Prg: Unterschied zwischen den Versionen

Aus Schäfer SAC
Zur Navigation springen Zur Suche springen
Keine Bearbeitungszusammenfassung
Keine Bearbeitungszusammenfassung
 
Zeile 1: Zeile 1:
Zotero (Zitieren)
legt Literaturliste an
pdfinfo liest den PDF-Header aus.<ref><pre>
A Dokument‑Metadaten
* Titel / Autor / Ersteller‑Programm (z. B. Word, LibreOffice, LaTeX)
* Erstellungsdatum / Änderungsdatum / Produzent (z. B. Adobe PDF Library) / PDF‑Version (1.3–1.7, PDF/A usw.)
B Struktur & Seiteninformationen
* Anzahl der Seiten / Seitenformate (A4, Letter, Sondergrößen) / Seitenrotation (0°, 90°, 180°, 270°)
* Box‑Informationen (MediaBox, CropBox, TrimBox, BleedBox) / Ob die PDF getaggt ist (für Barrierefreiheit)
C Sicherheitsinformationen
* Verschlüsselt / unverschlüsselt / Verschlüsselungsstärke (40‑bit, 128‑bit, AES‑256)
* Erlaubte Aktionen (Drucken, Kopieren, Kommentieren)
* Inhaltsinformationen / Anzahl eingebetteter Schriftarten / Schriftarten‑Typen (TrueType, Type1, CID)
* Eingebettete oder nicht eingebettete Fonts / Farbprofile (ICC)
* b Transparenzen enthalten sind / Ob Formularfelder vorhanden sind
D Technische Details
* Linearisiert (für Web‑Optimierung) / Optimiert / komprimiert / XMP‑Metadaten vorhanden / PDF/A‑Konformität (A‑1b, A‑2a usw.)
</pre></ref>
  GROBID (Java-Script)
  GROBID (Java-Script)
  wertet PDF-Dateien aus und legt die Ergebnisse<ref group="Anm.">
  wertet PDF-Dateien aus und legt die Ergebnisse<ref group="Anm.">
Zeile 46: Zeile 68:
  pause
  pause
</pre></ref>
</pre></ref>
Zotero (Zitieren)
legt Literaturliste an





Aktuelle Version vom 31. August 2026, 23:07 Uhr

Zotero (Zitieren)
legt Literaturliste an
pdfinfo liest den PDF-Header aus.[1]


GROBID (Java-Script)
wertet PDF-Dateien aus und legt die Ergebnisse[Anm. 1] in einer eigenen Datei für jede PDF-Datei an.
grobid-client --input Pfad\zu\HSS\ --output results\ --recursive[Anm. 2]


Anhang

Anmerkungen

  1. A) Dokumentstruktur
    * Titel / Untertitel / Autoren / Institutionen / Abstract / Keywords / Sprache 
    * Publikationsjahr / DOI (falls vorhanden) / ISBN/ISSN (falls vorhanden)
    B) Seiteninformationen
    * Seitenzahl (immer zuverlässig) / Seitenstruktur (Header/Footer, Abschnittsgrenzen)
    C) Fußnoten
    * GROBID erkennt Fußnoten als: <note> / <ref type="footnote">
    D) Quellen / Literaturverzeichnis
    * GROBID erkennt: Literaturverzeichnis / „References“ / „Bibliography“ / „Literatur“ / „Quellen“
    * Jede Quelle wird als eigenes <biblStruct>‑Element ausgegeben.
    E) Textkörper vs. Anhänge
    * GROBID unterscheidet: 
     <div type="body"> → Haupttext
     <div type="appendix"> → Anhänge
     <div type="annex"> → Zusatzmaterial
     <figure> / <table> → eingebettete Elemente
    F) Weitere Elemente
    * Tabellen / Abbildungen / Überschriften / Kapitelstruktur / Zitate / Referenzverweise / Formeln (teilweise)
    
  2.  @echo off
     REM Pfade anpassen
     set GROBID_HOME=C:\grobid
     set INPUT_DIR=C:\HSS_1800
     set OUTPUT_DIR=C:\HSS_1800_TEI
    
     REM GROBID-Service starten
     start "GROBID" java -jar %GROBID_HOME%\grobid-service\grobid-service.jar
    
     REM Warten bis der Service läuft
     timeout /t 5
    
     REM Batch-Verarbeitung starten
     python %GROBID_HOME%\grobid-client\grobid_client.py \
        --input %INPUT_DIR% \
        --output %OUTPUT_DIR% \
        --processFulltext \
        --recursive
    
     echo Verarbeitung abgeschlossen.
     pause
    

Einzelnachweise

  1. A Dokument‑Metadaten
    * Titel / Autor / Ersteller‑Programm (z. B. Word, LibreOffice, LaTeX) 
    * Erstellungsdatum / Änderungsdatum / Produzent (z. B. Adobe PDF Library) / PDF‑Version (1.3–1.7, PDF/A usw.)
    B Struktur & Seiteninformationen
    * Anzahl der Seiten / Seitenformate (A4, Letter, Sondergrößen) / Seitenrotation (0°, 90°, 180°, 270°)
    * Box‑Informationen (MediaBox, CropBox, TrimBox, BleedBox) / Ob die PDF getaggt ist (für Barrierefreiheit)
    C Sicherheitsinformationen
    * Verschlüsselt / unverschlüsselt / Verschlüsselungsstärke (40‑bit, 128‑bit, AES‑256)
    * Erlaubte Aktionen (Drucken, Kopieren, Kommentieren)
    * Inhaltsinformationen / Anzahl eingebetteter Schriftarten / Schriftarten‑Typen (TrueType, Type1, CID)
    * Eingebettete oder nicht eingebettete Fonts / Farbprofile (ICC)
    * b Transparenzen enthalten sind / Ob Formularfelder vorhanden sind
    D Technische Details
    * Linearisiert (für Web‑Optimierung) / Optimiert / komprimiert / XMP‑Metadaten vorhanden / PDF/A‑Konformität (A‑1b, A‑2a usw.)