@lzhzzzzwill/cofos 1.1.8 → 1.1.9

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
package/bin/cofos.js CHANGED
@@ -175,8 +175,8 @@ function main() {
175
175
  HF_HUB_ENABLE_HF_TRANSFER: process.env.HF_HUB_ENABLE_HF_TRANSFER || "0",
176
176
  HF_HUB_DOWNLOAD_TIMEOUT: process.env.HF_HUB_DOWNLOAD_TIMEOUT || "120",
177
177
  HF_HUB_ETAG_TIMEOUT: process.env.HF_HUB_ETAG_TIMEOUT || "30",
178
- HF_HUB_VERBOSITY: process.env.HF_HUB_VERBOSITY || "warning",
179
- TRANSFORMERS_VERBOSITY: process.env.TRANSFORMERS_VERBOSITY || "warning",
178
+ HF_HUB_VERBOSITY: process.env.HF_HUB_VERBOSITY || "error",
179
+ TRANSFORMERS_VERBOSITY: process.env.TRANSFORMERS_VERBOSITY || "error",
180
180
  };
181
181
  const proc = spawn(py, backendArgs, {
182
182
  stdio: ["pipe", "pipe", "pipe"],
package/package.json CHANGED
@@ -1,6 +1,6 @@
1
1
  {
2
2
  "name": "@lzhzzzzwill/cofos",
3
- "version": "1.1.8",
3
+ "version": "1.1.9",
4
4
  "description": "COFOS 9B + RAG chat CLI with optional local PDF ingestion.",
5
5
  "type": "module",
6
6
  "bin": {
@@ -42,7 +42,7 @@ generation:
42
42
  temperature: 0.2
43
43
  top_p: 0.9
44
44
  max_new_tokens: 1024
45
- do_sample: true
45
+ do_sample: false
46
46
  repetition_penalty: 1.08
47
47
  num_beams: 1
48
48
  no_repeat_ngram_size: 0
@@ -51,6 +51,7 @@ generation:
51
51
  refine_answers: false
52
52
  stream_refinement: false
53
53
  refinement_max_new_tokens: 512
54
+ remove_invalid_values: true
54
55
  data_processing:
55
56
  chunk_size: 768
56
57
  chunk_overlap: 50
@@ -181,6 +181,7 @@ class StudentAdapterInference:
181
181
  self.num_beams = int(generation_config.get("num_beams", 1))
182
182
  self.no_repeat_ngram_size = int(generation_config.get("no_repeat_ngram_size", 0))
183
183
  self.min_new_tokens = int(generation_config.get("min_new_tokens", 0))
184
+ self.remove_invalid_values = bool(generation_config.get("remove_invalid_values", True))
184
185
  self.history_max_turns = int(generation_config.get("history_max_turns", 4))
185
186
  self.refine_answers = bool(generation_config.get("refine_answers", True))
186
187
  self.stream_refinement = bool(generation_config.get("stream_refinement", True))
@@ -283,6 +284,7 @@ class StudentAdapterInference:
283
284
  "repetition_penalty": self.repetition_penalty,
284
285
  "eos_token_id": self.tokenizer.eos_token_id,
285
286
  "pad_token_id": self.tokenizer.pad_token_id,
287
+ "remove_invalid_values": self.remove_invalid_values,
286
288
  }
287
289
  if self.do_sample:
288
290
  kwargs["temperature"] = self.temperature
package/scripts/chat.py CHANGED
@@ -24,8 +24,8 @@ os.environ.setdefault("HF_HUB_DISABLE_XET", "1")
24
24
  os.environ.setdefault("HF_HUB_ENABLE_HF_TRANSFER", "0")
25
25
  os.environ.setdefault("HF_HUB_DOWNLOAD_TIMEOUT", "120")
26
26
  os.environ.setdefault("HF_HUB_ETAG_TIMEOUT", "30")
27
- os.environ.setdefault("HF_HUB_VERBOSITY", "warning")
28
- os.environ.setdefault("TRANSFORMERS_VERBOSITY", "warning")
27
+ os.environ.setdefault("HF_HUB_VERBOSITY", "error")
28
+ os.environ.setdefault("TRANSFORMERS_VERBOSITY", "error")
29
29
 
30
30
  HISTORY_FILE = os.path.join(os.path.expanduser("~"), ".cofos_history.jsonl")
31
31
  HISTORY_MAX_TURNS = 20
@@ -474,7 +474,7 @@ def main() -> None:
474
474
  from inference.student_adapter_inference import StudentAdapterInference, StudentRAGContext
475
475
 
476
476
  debug = os.environ.get("COFOS_DEBUG", "").lower() in {"1", "true", "yes", "on"}
477
- log_level = logging.INFO if debug else logging.WARNING
477
+ log_level = logging.INFO if debug else logging.ERROR
478
478
  logging.basicConfig(
479
479
  level=log_level,
480
480
  format="%(asctime)s - %(levelname)s - %(message)s",
@@ -586,7 +586,8 @@ def main() -> None:
586
586
  answer = "".join(answer_parts)
587
587
  gen_elapsed = time.time() - t_gen
588
588
  print("\n===DONE===", flush=True)
589
- print(f"[chat] Generated in {gen_elapsed:.1f}s", file=sys.stderr, flush=True)
589
+ if os.environ.get("COFOS_DEBUG", "").lower() in {"1", "true", "yes", "on"}:
590
+ print(f"[chat] Generated in {gen_elapsed:.1f}s", file=sys.stderr, flush=True)
590
591
 
591
592
  # Persist both turns only once the answer completed, so an
592
593
  # interrupted generation cannot leave a dangling user turn behind.
@@ -595,7 +596,8 @@ def main() -> None:
595
596
  _save_turn("user", question)
596
597
  _save_turn("assistant", answer)
597
598
  except Exception as exc:
598
- logging.exception("Generation failed")
599
+ if os.environ.get("COFOS_DEBUG", "").lower() in {"1", "true", "yes", "on"}:
600
+ logging.exception("Generation failed")
599
601
  print(f"\n[COFOS error] {exc}")
600
602
  print("===DONE===", flush=True)
601
603