Skip to content

Commit 9ac7129

Browse files
authored
update-4x-docs (#2802)
1 parent 315704a commit 9ac7129

20 files changed

Lines changed: 397 additions & 216 deletions

docs/.gitignore

Lines changed: 3 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -0,0 +1,3 @@
1+
# Generated by maven-antrun-plugin from antora-playbook.yml at build time.
2+
# Contains the current git-commit stamp injected for the docs home page.
3+
antora-playbook-stamped.yml

docs/build-docs.sh

Lines changed: 0 additions & 53 deletions
This file was deleted.
Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -1 +1 @@
1-
../../../../tika-parsers/tika-parsers-standard/tika-parsers-standard-package/src/test/resources/config-examples/migration-full-example.json
1+
../../../../tika-parsers/tika-parsers-standard/tika-parsers-standard-integration-tests/src/test/resources/config-examples/migration-full-example.json
Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -1 +1 @@
1-
../../../../tika-parsers/tika-parsers-standard/tika-parsers-standard-package/src/test/resources/config-examples/pdf-parser-basic.json
1+
../../../../tika-parsers/tika-parsers-standard/tika-parsers-standard-integration-tests/src/test/resources/config-examples/pdf-parser-basic.json
Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -1 +1 @@
1-
../../../../tika-parsers/tika-parsers-standard/tika-parsers-standard-package/src/test/resources/config-examples/pdf-parser-full.json
1+
../../../../tika-parsers/tika-parsers-standard/tika-parsers-standard-integration-tests/src/test/resources/config-examples/pdf-parser-full.json
Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -1 +1 @@
1-
../../../../tika-parsers/tika-parsers-standard/tika-parsers-standard-package/src/test/resources/config-examples/tesseract-basic.json
1+
../../../../tika-parsers/tika-parsers-standard/tika-parsers-standard-integration-tests/src/test/resources/config-examples/tesseract-basic.json
Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -1 +1 @@
1-
../../../../tika-parsers/tika-parsers-standard/tika-parsers-standard-package/src/test/resources/config-examples/tesseract-full.json
1+
../../../../tika-parsers/tika-parsers-standard/tika-parsers-standard-integration-tests/src/test/resources/config-examples/tesseract-full.json

docs/modules/ROOT/nav.adoc

Lines changed: 0 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -46,7 +46,6 @@
4646
** xref:migration-to-4x/chunk-strategies.adoc[Chunk Strategies]
4747
** xref:migration-to-4x/inference-handler-requirements.adoc[Inference Handler Requirements]
4848
* xref:advanced/index.adoc[Advanced]
49-
** xref:advanced/charset-detection-design.adoc[Charset Detection Pipeline]
5049
** xref:advanced/language-detection.adoc[Language Detection]
5150
** xref:advanced/language-detection-build.adoc[Building the Language Detector]
5251
** xref:advanced/junk-detection.adoc[Text Quality Scoring (Junk Detection)]

docs/modules/ROOT/pages/advanced/charset-detection-design.adoc

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -510,4 +510,4 @@ with feature hashing. The move to NB was driven by:
510510
== See also
511511

512512
* Configuration: xref:../configuration/encoding-detectors.adoc[Configuring Encoding Detectors]
513-
* Language detection: xref:language-detection.adoc[Language Detection]
513+
* Language detection: xref:advanced/language-detection.adoc[Language Detection]

docs/modules/ROOT/pages/advanced/junk-detection-build.adoc

Lines changed: 8 additions & 8 deletions
Original file line numberDiff line numberDiff line change
@@ -58,11 +58,11 @@ Source data lives in one directory per language (ISO 639 code), each containing
5858
up to two files:
5959

6060
`sentences_wikipedia.txt`::
61-
Line-numbered Wikipedia sentences: `{lineNum}{TAB}{text}`.
61+
Line-numbered Wikipedia sentences: `\{lineNum}\{TAB}\{text}`.
6262
One sentence per line.
6363

6464
`sentences_madlad.txt`::
65-
Line-numbered MADLAD-400 documents: `{lineNum}{TAB}{text}`.
65+
Line-numbered MADLAD-400 documents: `\{lineNum}\{TAB}\{text}`.
6666
Documents contain literal two-character `\n` escape sequences as
6767
sub-sentence separators. The tool splits on these before processing.
6868

@@ -108,16 +108,16 @@ per script:
108108
|===
109109
| File | Split | Purpose
110110

111-
| `{script}.train.gz`
111+
| `\{script}.train.gz`
112112
| 80%
113113
| Bigram count accumulation in `TrainJunkModel`.
114114

115-
| `{script}.dev.gz`
115+
| `\{script}.dev.gz`
116116
| 10%
117117
| Calibration (mu/sigma estimation) in `TrainJunkModel`.
118118
Also used for iterative evaluation during development.
119119

120-
| `{script}.test.gz`
120+
| `\{script}.test.gz`
121121
| 10%
122122
| **Held out completely.** Use only for final reported evaluation numbers.
123123
Never use to make model or threshold decisions.
@@ -146,7 +146,7 @@ Key options:
146146

147147
| `--output-dir`
148148
| `~/datasets/madlad/junkdetect`
149-
| Where to write `{script}.train.gz`, `.dev.gz`, `.test.gz`, and `manifest.tsv`.
149+
| Where to write `\{script}.train.gz`, `.dev.gz`, `.test.gz`, and `manifest.tsv`.
150150

151151
| `--total-budget-bytes`
152152
| `50000000`
@@ -178,7 +178,7 @@ then calibrates z-score statistics from the `.dev.gz` file.
178178

179179
=== Bigram table training
180180

181-
[source]
181+
[source,subs="-attributes"]
182182
----
183183
for each sentence in {script}.train.gz:
184184
utf8 = sentence.getBytes(UTF-8)
@@ -197,7 +197,7 @@ a small but nonzero probability for novel byte sequences.
197197

198198
=== Calibration
199199

200-
For each sentence in `{script}.dev.gz`:
200+
For each sentence in `\{script}.dev.gz`:
201201

202202
[source]
203203
----

0 commit comments

Comments
 (0)