Hallo,
ich bin zur Zeit daran, ähnlich wie im alten Turbo Pascal, eine Hilfe zu programmieren, mit nibbleweiser (HalbByte) Comprimierung (Bits 1..14= die am häufigsten vorkommenden Zeichen, 15 = folgende beiden Nibble= ASCII-Code des nächsten Zeichens, 0 = StringEnde), dadurch wird der Text um etwa 1/3 verkleinert,
und das Dateiverzeichnis mit DeltaAufteilung der Dateinamen : [neu := copy(alt, 1, vorlg) + rest; alt:=neu], mit dem Byte vorlg = Länge des Strings, der vom Beginn des vorherigen Eintrags übernommen wird, rest = der sich vom vorherigen Eintrag unterscheidende Rest.
Habe alle HTML-Doc-Dateien (für FPC und Lazarus) in ein eigenes Verzeichnis LazDocs kopiert, (dazu auch alle Wiki-Dateien, die ich herunterladen konnte). Das ergibt im komprimierten Delta-Dateiverzeichnis etwa 600K, mit ca. 41300 Dateinamen. Dazu kommt dann noch das Array der 41300 SeitenOffsets (wahrscheinlich kann ich da auch wie in THELP 3-Byte-Zahlen nehmen, das weiß ich aber jetzt noch nicht, noch kenne ich ja nicht die Länge der komprimierten HTML-Seiten...).
Ich möchte jetzt alle diese Dateien (mit den entsprechenden Links im Text) nacheinander in diesem komprimierten Format abspeichern. Hat jemand dazu einen kleinen HTML-Parser, den ich dazu verwenden kann? (Der in Lazarus bei den Webtools ist mir viel zu kompliziert, da muß ich mir wohl einen eigenen basteln...).
Ich habe jetzt nur eine Frage: Wenn ich die Daten dann ausgeben will, um den Text auch lesen zu können, ist es da besser, ein TImage zu nehmen oder eine TPaintbox (oder noch etwas anderes?), und dann mit TCanvas zu arbeiten? Ich möchte nämlich beim "Blättern" und Verschieben des Textes auch Bilder/Grafiken mit verschieben, die zum Text dazugehören.
Was wäre denn der Vor- bzw. Nachteil der ein oder anderen Version?
Herzlichen Dank für alle Vorschläge!