Markus W. schrieb:
Ich brauch ein Programm, das mir hilft automatisiert die pdf Artikel
des c't Magazins downzuloaden.
Sowas macht man sich am besten selber, weil die Zeitungsleute die Angewohnheit haben, den Aufbau der Seiten/Namen/… dann und wann zu ändern.
Hier ein Beispiel aus meinem „Abholprogramm“ für die Aachener Zeitung, die versenden täglich eine E-Mail mit einem Link drin, der nur einen Tag lang gilt.
Mein E-Mail-Programm lasse ich also ein Shellscript aufrufen, das den Text durchsucht und das Herunterladen mit „wget“ automatisiert:
1 |
URL=`grep 'https:\/\/epaper.*aachen.*\.de\/.*\.pdf' $1|sed -e 's/.*<a h.r.e.f.=\"//' -e 's/\">Jetzt herunterladen<\/a>.*//'`
|
(alles 1 Zeile)
Die Punkte aus „h.r.e.f.“ müssen weg, das Forum hält das für Spam, wenn ich es richtig schreibe.
„grep“ findet anhand unveränderlicher Namensbestamdteile die Zeile mit dem aktuellen Dateinamen (https://wo-auch-immer/Name.pdf), „sed“ schneidet den aus der Zeile aus, indem alles davor und alles dahinter „weggeschmissen“ wird, der Rest steht danach in der Variable „URL“.
Dann abholen:
Ich benenne die seltsam benannte Datei dann noch mit dem Abhol-Datum um.
Wenn es bei Dir keine E-Mail ist, sondern eine Webseite, wo Du den Link drauf findest, halt 2 Mal „wget“: erst Seite laden, wo's steht, daraus „extrahieren“, dann wie gehabt Herunterladen.
Das paßt jetzt nicht mehr nach „Markt“, ich weiß aber auch nicht, ob/wie man das ändern könnte.
Grüße, Christoph