Data Characteristics for This Product Category
Data for attenuated and inactivated vaccine products primarily originates from drug registration approvals, manufacturing process specifications, quality standards, clinical trial reports, and adverse event monitoring data. The update frequency for this data is relatively low, typically occurring with drug registrations, amendments, or annual reports. Document structures are predominantly a mix of normative text and structured data. For example, registration approvals include textual descriptions such as approval conclusions, indications, and dosage, alongside structured tables detailing active ingredients, excipients, and manufacturing process parameters. Fields and units are highly specialized, including vaccine potency units (TCID50, PFU), antigen content (μg/mL), adjuvant concentration (mg/dose), batch numbers, expiration dates, and storage conditions. Clinical trial reports contain subject IDs, dosages, and observation indicators (e.g., seroconversion rates, antibody titers).
Constraints Imposed by These Characteristics on Model Integration and Configuration
The highly specialized and standardized nature of attenuated and inactivated vaccine data requires models to accurately identify and parse professional terminology and units of measurement during knowledge base construction. Low update frequency means the knowledge base can adopt periodic full or incremental update strategies, without requiring frequent real-time synchronization. The mixed document structure necessitates combining text extraction with table parsing techniques to effectively integrate unstructured descriptions with structured data. For example, extracting indication information from approval text while identifying potency units from quality standard tables. The strictness of fields and units demands higher precision from model outputs, preventing misjudgments due to unit confusion or numerical errors. For instance, when answering vaccine dosage questions, the unit must be accurately included, not just the numerical value.
Configuration Guidelines
| Configuration Item | Recommended Value | Rationale |
|---|---|---|
Chunk size (Chunk Size) | 800–1200 characters | Accommodates long descriptions and table content in drug approvals and clinical reports, preserving contextual integrity. |
Recall count (Recall Count) | Top 8 | Ensures coverage of key information snippets from multiple relevant approvals or reports in complex queries. |
Similarity threshold (Similarity Threshold) | 0.78–0.85 | Balances precision for specialized terminology matching with recall rate for semantic relevance, avoiding irrelevant recalls. |
Rerank result count (Reranked Return Count) | Top 5 | Filters recalled results to focus on the most relevant and authoritative document snippets. |
maxContext | 8192 tokens | Supports the context requirements for processing longer texts like vaccine product inserts and clinical trial reports. |
PARSE_FILE_TIMEOUT_SECONDS | 600 seconds | Handles processing time when parsing large PDF drug registration approvals or clinical report files. |
Common Pitfalls
- Model output for vaccine dosage or potency lacks units, or units are incorrect. This happens because units were not independently tagged during knowledge base construction or unit recognition was not reinforced during model training.
- When querying for specific vaccine side effects, the model's answer includes side effect information for unrelated products. This occurs when knowledge base chunking or vectorization does not clearly define data boundaries between different vaccine products, leading to similarity calculation confusion.
- When concurrent requests increase, model response latency significantly rises. This is due to insufficient index optimization in the knowledge base query backend (e.g., MongoDB) or FastGPT instance resource configuration (CPU, memory) failing to meet high concurrency access demands.
How to Confirm Correct Configuration
- Submit test questions containing vaccine names, batch numbers, and specific queries (e.g., "storage conditions," "contraindications") to check if the model accurately extracts and answers relevant information.
- Submit queries containing different potency or measurement units. Verify that the units in the model's output are accurate and compare them against the original documents.
- Simulate high concurrency scenarios. Observe FastGPT's response time and check system logs for slow queries or resource bottleneck warnings caused by knowledge base queries or model inference. This evaluates the concurrent performance threshold.
- Query a specific field for a vaccine (e.g., "inactivation steps in the manufacturing process"). Verify that the model correctly extracts key process descriptions from unstructured text.
Note: The values provided are common starting points. Measure them against your own samples for optimal performance.
Question material comes from public community discussions. Configuration values are common starting points and should be measured against your own samples. Verified on 2026-09-21.